OmDev Logo
GetYourJob
0
Publié aujourd'hui

Llmops - Model Serving - Socle Agentique - - Saint-Denis H/F

Entreprise
Localisation
Saint-Denis - 93
Hybride
Type de contrat
Freelance
Niveau
Senior
Rémunération
Pas de salaire renseigné

Salaire du marché

Médiane du marché
550€/j
Estimation
500€/jfourchette habituelle615€/j

Cette offre n'affiche pas de TJM. D'après 30 offres pour ce poste (Senior, France), le marché se situe autour de 550€/j (500€/j–615€/j).

TJM du marché pour AI/ML Engineer (Senior) en France : médiane 550 €/jour, P25–P75 : 500–615 €/jour, n = 30 offres. TJM Python à Paris

Baromètre TJM et salaires IT

Description du poste

Détail du poste


Le besoin
CONTEXTE Mission au sein d'un grand compte du Transport ferroviaire, sur la construction et l'exploitation d'un socle agentique IA. Le périmètre couvre le serving de modèles de langage (LLM), la mise en place des infrastructures d'inférence GPU sous Kubernetes, et l'outillage MLOps/LLMOps associé (observabilité, versioning, alerting). La mission s'inscrit dans un contexte hybride, basé à Saint-Denis (Île-de-France), pour une durée initiale d'un an ferme. MISSIONS PRINCIPALES - Concevoir et opérer l'infrastructure de serving de modèles LLM (APIs d'inférence, gestion des endpoints) - Déployer et administrer les workloads GPU sous Kubernetes pour l'inférence à grande échelle - Mettre en place et maintenir les pipelines MLOps/LLMOps (versioning de modèles, registre, promotion) - Implémenter les dispositifs d'observabilité : dashboards, alerting et monitoring des modèles en production - Développer et maintenir les composants Python du socle agentique (scripts, orchestration, intégrations API) - Assurer la fiabilité et la performance des APIs d'inférence exposées aux équipes consommatrices - Contribuer à la définition des standards et bonnes pratiques LLMOps au sein de l'équipe - Participer aux revues techniques et à la documentation du socle agentique COMPETENCES REQUISES - Python (développement des composants du socle agentique et scripts MLOps) - Kubernetes (déploiement et orchestration des workloads GPU d'inférence) - GPU (infrastructure d'inférence) (gestion des ressources GPU pour le serving de modèles LLM) - MLOps (pipelines de gestion du cycle de vie des modèles) - LLMOps (opérationnalisation spécifique des modèles de langage) - APIs d'inférence (exposition et gestion des endpoints de serving) - Observabilité (monitoring des modèles et de l'infrastructure en production) - Versioning de modèles (gestion des versions et registre de modèles) - Dashboards / Alerting (mise en place des tableaux de bord et alertes de supervision) COMPETENCES SOUHAITEES - vLLM / TGI (Text Generation Inference) (frameworks de serving LLM haute performance) - Helm / Kustomize (gestion des déploiements Kubernetes) - Prometheus / Grafana (stack d'observabilité et dashboarding) - MLflow / Weights & Biases (registre et tracking d'expériences de modèles) - Docker (conteneurisation des composants d'inférence) - Amazon Web Services ou Google Cloud Platform (infrastructure cloud sous-jacente) - LangChain / LlamaIndex (frameworks d'orchestration agentique) PROFIL RECHERCHE Expert LLMOps / Model Serving Engineer justifiant d'au minimum 7 ans d'expérience globale en ingénierie, dont une expertise avérée et récente sur l'opérationnalisation de modèles de langage (LLMOps), le serving GPU sous Kubernetes et la mise en place de dispositifs d'observabilité en production. Une expérience sur des socles agentiques ou des projets IA à grande échelle est fortement appréciée. Autonomie, rigueur technique et capacité à structurer des pratiques d'ingénierie dans un environnement complexe sont indispensables ; une bonne communication avec les équipes data et produit est attendue.

Le profil recherché

Profil recherchéExpert LLMOps / Model Serving Engineer justifiant d'au minimum 13 ans d'expérience globale en ingénierie, dont une expertise avérée et récente sur l'opérationnalisation de modèles de langage (LLMOps), le serving GPU sous Kubernetes et la mise en place de dispositifs d'observabilité en production. Une expérience sur des socles agentiques ou des projets IA à grande échelle est fortement appréciée. Autonomie, rigueur technique et capacité à structurer des pratiques d'ingénierie dans un environnement complexe sont indispensables ; une bonne communication avec les équipes data et produit est attendue.

Mais aussi...

Taux journalier :TJM 675 EUR/jour.css-11k7fwb{display:inline-block;white-space:nowrap;vertical-align:middle;-webkit-padding-start:var(--chakra-space-1-5);padding-inline-start:var(--chakra-space-1-5);-webkit-padding-end:var(--chakra-space-1-5);padding-inline-end:var(--chakra-space-1-5);text-transform:none;font-size:var(--chakra-fontSizes-xs);border-radius:var(--chakra-radii-md);font-weight:var(--chakra-fontWeights-semibold);background:var(--chakra-colors-success-200);color:var(--chakra-colors-success-700);box-shadow:var(--badge-shadow);padding:4px 6px;--badge-bg:var(--chakra-colors-success-100);--badge-color:colors.success.800;}.chakra-ui-dark .css-11k7fwb:not([data-theme]),[data-theme=dark] .css-11k7fwb:not([data-theme]),.css-11k7fwb[data-theme=dark]{--badge-bg:rgba(226, 243, 232, 0.16);--badge-color:var(--chakra-colors-success-200);}Cette offre est à 0% de commission .css-74lrwu{width:1em;height:1em;line-height:1em;-webkit-flex-shrink:0;-ms-flex-negative:0;flex-shrink:0;color:currentColor;font-size:16px;display:-webkit-box;display:-webkit-flex;display:-ms-flexbox;display:flex;-webkit-transition:.1s ease-in-out color;transition:.1s ease-in-out color;}.css-74lrwu *{-webkit-transition:.1s ease-in-out fill;transition:.1s ease-in-out fill;fill:var(--chakra-colors-rythm-600);}

Exigences du poste

Compétences requises

  • Python
  • Kubernetes
  • GPU
  • MLOps
  • LLMOps
  • API Development
  • Monitoring / Observability
  • Model Versioning
  • Reporting / Dashboards
  • vLLM
  • Text Generation Inference
  • Helm
  • Kustomize
  • Prometheus
  • Grafana
  • MLflow
  • Weights & Biases
  • Docker
  • AWS
  • Google Cloud Platform
  • LangChain
  • LlamaIndex

Un plus

  • Artificial Intelligence
  • Base
  • Scripting
  • Cloud
  • CSS
  • Chakra UI
  • LLM
  • Management d'équipe
  • Web Services

Toutes les offres Python à Paris

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

Publié par

Recruteur
Recruteur

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.