Observability Engineer
O pozici
Bude spolupracovat s infrastrukturním týmem (KVM/Ceph) i s týmy, které nad platformou provozují Kubernetes a databáze, proto se neobejde bez chuti rozumět systému napříč vrstvami.
O nás
Stavíme a provozujeme vlastní cloudovou infrastrukturu postavenou na open-source technologiích - virtualizaci KVM a distribuovaném úložišti Ceph. Naše platforma běží pod reálnou produkční zátěží a musí být vidět skrz naskrz: chceme přesně vědět, co se v ní děje, dřív než se to stane problémem.
Proto hledáme člověka, pro kterého je observabilita hlavní disciplína - ne položka v CV vedle deseti jiných.
Koho hledáme
Člověka, který umí udělat z chaosu dat srozumitelný obraz systému - metriky, logy, tracing, alerting - a navrhnout observabilitu tak, aby dávala odpovědi dřív, než se jich někdo zeptá. Bude spolupracovat s infrastrukturním týmem (KVM/Ceph) i s týmy, které nad platformou provozují Kubernetes a databáze, proto se neobejde bez chuti rozumět systému napříč vrstvami.
Čím se u nás budeš zabývat
Návrhem a rozvojem observability stacku (metriky, logování, distribuovaný tracing, alerting) napříč celou platformou
Definicí smysluplných SLI/SLO a dashboardů, které lidem skutečně pomáhají rozhodovat, ne jen hezky vypadají
Nastavením a laděním alertingu tak, aby upozorňoval na skutečné problémy, ne generoval šum
Škálováním monitoringu pro velké množství uzlů a vysokou kardinalitu metrik
Vyšetřováním incidentů a post-mortem analýzami - hledáním „proč“, ne jen „co“
Integrací observability do Kubernetes clusterů, databázových služeb i nižších vrstev infrastruktury (KVM, Ceph)
Automatizací nasazení a správy monitoring stacku (infrastructure-as-code)
Co od tebe očekáváme
Zkušenost s observability nástroji a přístupy (např. Prometheus, Grafana, Loki/ELK, OpenTelemetry, Alertmanager nebo obdobné)
Chápání rozdílu mezi „monitoring, který hlásí“ a „observabilitu, která vysvětluje“
Solidní znalost Linuxu (RHEL/Debian/Ubuntu)
Programovací/skriptovací dovednosti (Python, Go nebo podobné) pro automatizaci a vlastní tooling
Zkušenost s infrastrukturou jako kódem (Terraform, Ansible nebo podobné nástroje)
Schopnost komunikovat napříč týmy a vysvětlit, co data ukazují a proč na tom záleží
Vítáme navíc
Zkušenost s Kubernetes v produkci (cluster monitoring, service mesh observability)
Zkušenost s provozem a monitoringem databází (PostgreSQL, MySQL nebo obdobné)
Povědomí o KVM/libvirt nebo Ceph, případně jiném open-source virtualizačním/storage stacku
Zkušenost s distribuovanými systémy ve větším měřítku
Co nabízíme
Prostor navrhnout observability strategii od základu, ne jen udržovat to, co tu bylo
Práci na infrastruktuře, která reálně běží pod produkční zátěží a kde má observabilita smysl, ne je jen „nice to have“
Moderní open-source stack a možnost ovlivnit, kam se dál posune
Zázemí stabilní firmy s dlouhodobými projekty a týmem, na který se dá spolehnout
Pozice: Observability Engineer
Lokalita: Brno - Purkyňova
Úvazek: full-time