Senior Machine Learning Infrastructure Engineer | Full remote (home-office)
Nabízím práci
High Tech Engineering Center s.r.o.
Česká republika
Plný
Vysokoškolské
Angličtina
Informatika a IT služby
Nabízím práci
24. 8. 2026
O pozici
Pracovní nabídka
Budujeme systémy, které umožňují rychlé, spolehlivé a reprodukovatelné trénování modelů ve velkém měřítku. Na pozici Senior ML Infrastructure Engineer budete zodpovídat za trénovací platformu. Ne za samotné modely, ale za vše, co jejich vznik a provoz umožňuje.
Co budete dělat
- Navrhovat a spravovat distribuovanou trénovací infrastrukturu pro multi-GPU a multi-node prostředí (PyTorch FSDP/DDP, Ray Train).
- Budovat a vlastnit ML CI/CD pipeline, včetně automatizovaného testování, regresních testů a evaluačních frameworků, které schvalují změny modelů.
- Vyvíjet validační frameworky pro trénování: kontroly stability, diagnostiku stavu gradientů a ověřování checkpointů.
- Profilovat a optimalizovat výkon trénování se zaměřením na GPU paměť, výpočetní výkon a komunikační bottlenecky v NCCL.
- Podporovat infrastrukturu pro RL trénování (PPO/GRPO pipeline, úlohy reward modelů a škálované policy rollouty).
- Přetvářet prototypové skripty výzkumníků na produkčně nasaditelné, kvalitně testované systémy.
- Vlastnit nástroje pro reprodukovatelnost experimentů, včetně verzování artefaktů, deterministických běhů a integrace W&B/MLflow.
Koho hledáme
- 7+ let zkušeností v inženýrských rolích, z toho minimálně 3+ roky v oblasti ML infrastruktury nebo platform engineeringu.
- Hlubokou znalost PyTorch, včetně custom training loops, AMP/BF16, gradient checkpointingu a DDP/FSDP.
- Praktické zkušenosti s Ray Train pro orchestraci distribuovaných workloadů.
- Silné zkušenosti s vlastnictvím a správou CI/CD procesů pro ML codebase.
- Dobrou znalost GPU architektury a komunikačních vzorů distribuovaného trénování.
- Zkušenost s JAX/XLA je významnou výhodou.
- Zkušenost s infrastrukturou pro RL trénování je výhodou.