OmDev Logo
GetYourJob
0
Publié aujourd'hui

LLMOps / Model Serving – Socle agentique – – Saint-Denis - Freelance

Entreprise
Localisation
Saint-Denis
Hybride
Annoncé full remote
Type de contrat
Freelance
Niveau
Senior
Rémunération
675 €/jour• Taux journalier

Salaire du marché

Médiane du marché
550€/j
Au-dessus du marché
500€/jfourchette habituelle615€/j
Cette offre : 675€/j

Basé sur 30 offres pour ce poste (Senior, France, 3 dernières semaines). Fourchette habituelle 500€/j–615€/j, médiane 550€/j. Cette offre (675€/j) est au-dessus de la fourchette.

TJM du marché pour AI/ML Engineer (Senior) en France : médiane 550 €/jour, P25–P75 : 500–615 €/jour, n = 30 offres. TJM Python à Paris

Baromètre TJM et salaires IT

Description du poste

Taux journalier (TJM): TJM 675 EUR/jour
Mission au sein d'un grand compte du Transport ferroviaire, sur la construction et l'exploitation d'un socle agentique IA. Le périmètre couvre le serving de modèles de langage (LLM), la mise en place des infrastructures d'inférence GPU sous Kubernetes, et l'outillage MLOps/LLMOps associé (observabilité, versioning, alerting). La mission s'inscrit dans un contexte hybride, basé à Saint-Denis (Île-de-France), pour une durée initiale d'un an ferme.

  • Concevoir et opérer l'infrastructure de serving de modèles LLM (APIs d'inférence, gestion des endpoints)
  • Déployer et administrer les workloads GPU sous Kubernetes pour l'inférence à grande échelle
  • Mettre en place et maintenir les pipelines MLOps/LLMOps (versioning de modèles, registre, promotion)
  • Implémenter les dispositifs d'observabilité : dashboards, alerting et monitoring des modèles en production
  • Développer et maintenir les composants Python du socle agentique (scripts, orchestration, intégrations API)
  • Assurer la fiabilité et la performance des APIs d'inférence exposées aux équipes consommatrices
  • Contribuer à la définition des standards et bonnes pratiques LLMOps au sein de l'équipe
  • Participer aux revues techniques et à la documentation du socle agentique
  • Python (développement des composants du socle agentique et scripts MLOps)
  • Kubernetes (déploiement et orchestration des workloads GPU d'inférence)
  • GPU (infrastructure d'inférence) (gestion des ressources GPU pour le serving de modèles LLM)
  • MLOps (pipelines de gestion du cycle de vie des modèles)
  • LLMOps (opérationnalisation spécifique des modèles de langage)
  • APIs d'inférence (exposition et gestion des endpoints de serving)
  • Observabilité (monitoring des modèles et de l'infrastructure en production)
  • Versioning de modèles (gestion des versions et registre de modèles)
  • Dashboards / Alerting (mise en place des tableaux de bord et alertes de supervision)
  • vLLM / TGI (Text Generation Inference) (frameworks de serving LLM haute performance)
  • Helm / Kustomize (gestion des déploiements Kubernetes)
  • Prometheus / Grafana (stack d'observabilité et dashboarding)
  • MLflow / Weights & Biases (registre et tracking d'expériences de modèles)
  • Docker (conteneurisation des composants d'inférence)
  • Amazon Web Services ou Google Cloud Platform (infrastructure cloud sous-jacente)
  • LangChain / LlamaIndex (frameworks d'orchestration agentique)
Expert LLMOps / Model Serving Engineer justifiant d'au minimum 7 ans d'expérience globale en ingénierie, dont une expertise avérée et récente sur l'opérationnalisation de modèles de langage (LLMOps), le serving GPU sous Kubernetes et la mise en place de dispositifs d'observabilité en production. Une expérience sur des socles agentiques ou des projets IA à grande échelle est fortement appréciée. Autonomie, rigueur technique et capacité à structurer des pratiques d'ingénierie dans un environnement complexe sont indispensables ; une bonne communication avec les équipes data et produit est attendue.

Exigences du poste

Compétences requises

  • Python
  • Machine Learning
  • Kubernetes
  • LLMOps

Un plus

  • Artificial Intelligence
  • MLOps
  • Monitoring / Observability
  • Base
  • API Development
  • Reporting / Dashboards
  • Scripting
  • vLLM
  • Text Generation Inference
  • Helm
  • Kustomize
  • Prometheus

Toutes les offres Python à Paris

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

Publié par

Recruteur
Recruteur

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.