Szukamy doświadczonego inżyniera Linux/SRE do zespołu zajmującego się utrzymaniem i rozwojem infrastruktury HPC oraz klastrów GPU wykorzystywanych do AI.
Pracujemy na fizycznych serwerach, z Linuxem, sieciami Data Center i technologiami NVIDIA. Dużo automatyzujemy, korzystamy z Ansible, Pythona, Basha i Gita.
To nie jest typowa praca DevOps skupiona na chmurze i wdrażaniu aplikacji. Tutaj zdecydowanie więcej czasu spędza się na pracy z infrastrukturą, diagnozowaniu problemów i dbaniu o stabilność środowiska.
Czym będziesz się zajmować?
- Utrzymaniem i rozwojem infrastruktury Linux oraz klastrów HPC/GPU.
- Diagnozowaniem i rozwiązywaniem problemów produkcyjnych, zarówno systemowych, jak i sprzętowych czy sieciowych.
- Automatyzacją konfiguracji i zarządzania infrastrukturą.
- Rozwijaniem monitoringu i poprawianiem stabilności środowiska.
- Współpracą przy wdrożeniach i rozwiązywaniu incydentów.
- Dokumentowaniem rozwiązań i usprawnianiem codziennej pracy.
Czego oczekujemy (Hard Skills)?
- Bardzo dobrej znajomości Linuxa Debian-like i doświadczenia z systemami produkcyjnymi.
- Doświadczenia z bare-metal i infrastrukturą Data Center.
- Dobrej znajomości sieci (TCP/IP, DNS, VLAN, routing).
- Umiejętności samodzielnego diagnozowania problemów systemowych, sieciowych i wydajnościowych.
- Znajomości Ansible, Git oraz umiejętności pisania skryptów w Bashu i Pythonie.
- Doświadczenia z monitoringiem i narzędziami diagnostycznymi.
- Angielskiego pozwalającego na swobodną codzienną komunikację.
Mile widziane
- Doświadczenie z HPC, klastrami obliczeniowymi lub infrastrukturą GPU.
- Znajomość technologii NVIDIA (Cumulus, DCGM, NCCL, NHC, NVIDIA Container Toolkit).
- Znajomość InfiniBand, RDMA, SLURM.
- Doświadczenie z Prometheus, Grafana, GitLab CI/CD.
- Doświadczenie z rozproszonymi i klastrowymi systemami plików (Lustre, Ceph).
Kim jesteś (Soft Skills)?
- Potrafisz samodzielnie podejść do problemu i nie boisz się szukać rozwiązań.
- Lubisz współpracować z innymi i potrafisz jasno komunikować, co robisz.
- Bierzesz odpowiedzialność za swoją pracę i zmiany wprowadzane na produkcji.
- Chętnie automatyzujesz powtarzalne zadania.
- Nie masz problemu z pytaniem o pomoc ani dzieleniem się własną wiedzą.
Organizacja pracy
- Około 10-osobowy zespół podzielony na część operacyjną (SRE) i projektową.
- Godziny pracy 8:00–18:00, z dwugodzinną przerwą.
- Praca na Linuxie lub macOS.
- Scrum, regularne spotkania i dużo bezpośredniej komunikacji w zespole.
- Obecnie bez dyżurów nocnych i weekendowych, ale w przyszłości planowane jest wprowadzenie rotacyjnego on-call.
Co oferujemy?
- Pracę z dużymi klastrami GPU i infrastrukturą AI/HPC.
- Sporo samodzielności i realny wpływ na to, jak działa infrastruktura.
- Bezpośrednią współpracę z doświadczonymi inżynierami i Tech Leadem.
- Możliwość poznania i rozwijania się w technologiach HPC/AI GPU.
- Krótką ścieżkę decyzyjną, bez zbędnych formalności.