Taux journalier (TJM): TJM 675 EUR/jour
Mission au sein d'un grand compte du Transport ferroviaire, sur la construction et l'exploitation d'un socle agentique IA. Le périmètre couvre le serving de modèles de langage (LLM), la mise en place des infrastructures d'inférence GPU sous Kubernetes, et l'outillage MLOps/LLMOps associé (observabilité, versioning, alerting). La mission s'inscrit dans un contexte hybride, basé à Saint-Denis (Île-de-France), pour une durée initiale d'un an ferme.
- Concevoir et opérer l'infrastructure de serving de modèles LLM (APIs d'inférence, gestion des endpoints)
- Déployer et administrer les workloads GPU sous Kubernetes pour l'inférence à grande échelle
- Mettre en place et maintenir les pipelines MLOps/LLMOps (versioning de modèles, registre, promotion)
- Implémenter les dispositifs d'observabilité : dashboards, alerting et monitoring des modèles en production
- Développer et maintenir les composants Python du socle agentique (scripts, orchestration, intégrations API)
- Assurer la fiabilité et la performance des APIs d'inférence exposées aux équipes consommatrices
- Contribuer à la définition des standards et bonnes pratiques LLMOps au sein de l'équipe
- Participer aux revues techniques et à la documentation du socle agentique
- Python (développement des composants du socle agentique et scripts MLOps)
- Kubernetes (déploiement et orchestration des workloads GPU d'inférence)
- GPU (infrastructure d'inférence) (gestion des ressources GPU pour le serving de modèles LLM)
- MLOps (pipelines de gestion du cycle de vie des modèles)
- LLMOps (opérationnalisation spécifique des modèles de langage)
- APIs d'inférence (exposition et gestion des endpoints de serving)
- Observabilité (monitoring des modèles et de l'infrastructure en production)
- Versioning de modèles (gestion des versions et registre de modèles)
- Dashboards / Alerting (mise en place des tableaux de bord et alertes de supervision)
- vLLM / TGI (Text Generation Inference) (frameworks de serving LLM haute performance)
- Helm / Kustomize (gestion des déploiements Kubernetes)
- Prometheus / Grafana (stack d'observabilité et dashboarding)
- MLflow / Weights & Biases (registre et tracking d'expériences de modèles)
- Docker (conteneurisation des composants d'inférence)
- Amazon Web Services ou Google Cloud Platform (infrastructure cloud sous-jacente)
- LangChain / LlamaIndex (frameworks d'orchestration agentique)
Expert LLMOps / Model Serving Engineer justifiant d'au minimum 7 ans d'expérience globale en ingénierie, dont une expertise avérée et récente sur l'opérationnalisation de modèles de langage (LLMOps), le serving GPU sous Kubernetes et la mise en place de dispositifs d'observabilité en production. Une expérience sur des socles agentiques ou des projets IA à grande échelle est fortement appréciée. Autonomie, rigueur technique et capacité à structurer des pratiques d'ingénierie dans un environnement complexe sont indispensables ; une bonne communication avec les équipes data et produit est attendue.