OmDev Logo
GetYourJob
0
Publié il y a 184 jours

Senior ML Infrastructure / DevOps Engineer

Entreprise
PathwayRecrute en direct
Localisation
Paris
Hybride
Type de contrat
CDI
Niveau
Senior
Rémunération
45000–67500 €/an

Salaire du marché

Médiane du marché
50k€
Estimation
43k€fourchette habituelle55k€

Cette offre n'affiche pas de salaire. D'après 61 offres pour ce poste (Senior, Île-de-France), le marché se situe autour de 50k€ (43k€–55k€).

0vues
0clics

Description du poste

Senior ML Infrastructure / DevOps Engineer (H/F)

Entreprise: Pathway
Type de contrat: CDI
Localisation: Paris (75)
Salaire: 45 000 – 67 500 €/an (estimation Hellowork)
Mode de travail: Télétravail partiel (partiel)
Niveau d’études: Bac +5
Référence: 5

À propos de Pathway

Pathway révolutionne l’intelligence artificielle en introduisant le premier modèle post-transformer capable de s’adapter et de raisonner comme un humain. Leur architecture innovante (BDH) surpasse les modèles Transformer en offrant une visibilité totale sur le fonctionnement des modèles, combinée à l’ingénierie de données la plus performante du marché.
Grâce à cette combinaison, les entreprises peuvent dépasser l’optimisation incrémentale pour atteindre une intelligence contextualisée et basée sur l’expérience. Pathway est déjà adopté par des acteurs majeurs comme NATO, La Poste et les équipes de course de Formule 1.
Fondée par Zuzanna Stamirowska, complexité scientifique et CEO, Pathway rassemble une équipe d’avant-gardistes en IA, incluant :
  • Jan Chorowski, CTO et pionnier de l’Attention appliquée à la reconnaissance vocale (anciennement chez Google Brain avec le lauréat du prix Nobel Geoffrey Hinton).
  • Adrian Kosowski, CSO et physicien quantique, docteur à 20 ans.
  • Soutenue par des investisseurs et conseillers de premier plan, dont TQ Ventures et Lukasz Kaiser, co-auteur du Transformer (la technologie derrière ChatGPT) et chercheur clé chez OpenAI.
Pathway est basée à Palo Alto, Californie.

Pathway recherche un Senior ML Infrastructure / DevOps Engineer passionné par Linux, les systèmes distribués et le scaling de clusters GPU – bien plus que par les notebooks. Vous serez responsable de l’infrastructure qui alimente les charges de travail d’entraînement et d’inférence ML, depuis les bases Linux jusqu’à l’orchestration de conteneurs et aux pipelines CI/CD.
Votre rôle ? Allier R&D et production :
  • Clusters, réseaux, stockage, observabilité et automatisation.
  • Vos décisions détermineront la vitesse d’entraînement, de déploiement et d’itération des modèles.

Pourquoi ce poste est unique ?

  • Gestion et scaling de clusters GPU intensifs, utilisés quotidiennement par l’équipe R&D pour l’entraînement à grande échelle et l’inférence à faible latence.
  • Conception et automatisation d’une plateforme ML (et non simple exécution de playbooks prédéfinis).
  • Multi-cloud : résolution de problèmes complexes en réseautage, planification et optimisation coût/performance à grande échelle.

Vos missions principales

  • Architecture et scaling :
  • Clusters GPU/CPU pour l’entraînement et l’inférence (Slurm, Kubernetes, autoscaling, gestion des files d’attente et quotas).
  • Infrastructure as Code (IaC) :
  • Provisionnement et configuration automatisés (Terraform, CloudFormation, outils de clustering).
  • Pipelines ML robustes :
  • Ingestion de données, entraînement, évaluation et déploiement, avec garanties de reproductibilité, traçabilité et rollback.
  • CI/CD centré ML :
  • Tests, packaging et déploiement de modèles et services.
  • Observabilité et monitoring :
  • Surveillance (Grafana, Prometheus, Loki, CloudWatch) pour :
  • Utilisation GPU/CPU, latence, débit, pannes, dérive de données/modèles.
  • Gestion de données massives :
  • Défis liés au stockage, au réseau et aux performances avec des terabytes de données.
  • Collaboration avec les équipes ML :
  • Production des travaux expérimentaux en systèmes robustes et scalables.
  • SLA et incident management :
  • Participation à la rotation on-call pour l’infrastructure critique ML et conduite des postmortems.


Profil recherché :
  • Expertise technique en DevOps, ML Infrastructure et scaling de clusters GPU.
  • Maîtrise des outils : Slurm, Kubernetes, Terraform, CloudFormation, CI/CD, monitoring (Grafana/Prometheus), et langages Python/Shell.
  • Passion pour les systèmes distribués, l’automatisation et l’optimisation des performances.
  • Capacité à traduire des environnements expérimentaux en solutions production-ready.

Exigences du poste

Stack technique :

Linux AdministrationSoftware ArchitectureSlurmKubernetesTerraformAWS ServicesCI/CDGrafanaPrometheusLokiAmazon CloudWatchGPU/CPU ClustersAutoscalingQueueing SystemsQuota ManagementPythonBashScriptingDockerKubernetes OperatorsML PipelinesData IngestionModel TrainingModel EvaluationModel DeploymentMonitoring / ObservabilityLoggingNetwork AdministrationStorage Optimization

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

Publié par

Recruteur
Recruteur
Voir sur LinkedIn

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.