OmDev Logo
GetYourJob
0
Publié il y a 28 jours

Ingénieur Cloud & MlOps

Entreprise
Localisation
Lyon, Auvergne-Rhone-Alpes, France
Hybride
Type de contrat
CDI
Niveau

Salaire du marché

Médiane du marché
48k€
Estimation
43k€fourchette habituelle48k€

Cette offre n'affiche pas de salaire. D'après 15 offres pour ce poste (tous niveaux, Lyon), le marché se situe autour de 48k€ (43k€–48k€).

0vues
0clics

Description du poste

1. Contexte

Le 1817 est la digital factory du groupe Vicat, présent dans 12 pays. Entité autonome dans son fonctionnement et ses méthodes, elle réunit trois conditions rarement présentes ensemble : la capacité d’innover et d’itérer vite, un terrain d’application immédiat et exigeant, et la solidité d’un groupe industriel international.

Nos sujets partent du terrain industriel : conduite et optimisation de procédés, maîtrise de la qualité, performance énergétique, maintenance, sécurité, supply chain. Les solutions que nous produisons ne sont pas des démonstrateurs : elles sont mises en service sur des sites de production, utilisées quotidiennement par les exploitants, et suivies dans la durée.

Ces solutions ne s’arrêtent pas aux frontières du groupe Vicat. Les produits et services que nous développons ont tous vocation à être proposés à des acteurs externes – plusieurs le sont déjà. Cette double destination change la manière de concevoir : ce que nous construisons doit être suffisamment robuste, générique et documenté pour fonctionner ailleurs que sur le site où il a été imaginé.

Le portefeuille de cas d’usage est en croissance rapide afin de couvrir l’ensemble des fonctions, de la conduite d’installation aux fonctions support. Cette croissance fait de la capacité à industrialiser, déployer et exploiter dans la durée un enjeu central : les sujets ne manquent pas, l’enjeu est d’en transformer le plus grand nombre en solutions réellement utilisées.

L’équipe réunit des chefs de projet, des responsables de déploiement, des data scientists, des développeurs et des ingénieurs plateforme, qui travaillent ensemble sur l’ensemble du cycle de vie de nos solutions.

2. Missions principales

a)    Concevoir, construire et opérer la plateforme sur laquelle tournent nos solutions, du cloud au datacenter interne jusqu’aux équipements de terrain : réseau, identités, secrets, environnements décrits en code, ressources de calcul – malgré la ségrégation des réseaux IT et OT.

b)    Rendre reproductible le déploiement d’une solution sur un nouveau site ou chez un nouveau client : orchestration élastique, briques d’infrastructure et standards réutilisables. L’objectif est qu’un nouveau déploiement relève du paramétrage, pas du projet.

c)     Industrialiser la mise en production des modèles : packaging, chaînes de déploiement, versioning et rollback, registry et lineage, automatisation du réentraînement – avec les garde-fous qu’impose un modèle qui agit sur un procédé réel.

d)    Exploiter dans la durée : niveaux de service tenus avec les sites, gestion des incidents, sécurité opérationnelle, sauvegarde et reprise, maîtrise de la capacité et des coûts. Ce qui tourne sur un site de production doit continuer à tourner.

e)    Mettre en place l’observabilité de bout en bout : infrastructure et applicatif, mais aussi dérive des données et des modèles, tenue du gain métier dans la durée et retour d’usage des exploitants.

f)     Outiller l’équipe et diffuser les pratiques : fournir aux data scientists et aux développeurs les chaînes, environnements et standards qui leur permettent de mettre en production de façon autonome – revues de code, veille technologique, partage de connaissances.

Ce que le poste n’est pas

Vous n’entraînez pas les modèles et ne concevez pas les algorithmes : c’est le métier des data scientists de l’équipe. En revanche, vous connaissez les outils du ML et les contraintes propres à un modèle en production – versions, données, dérive, non-déterminisme – parce que ce sont elles qui dictent la manière dont la plateforme est construite. À l’inverse, ce n’est pas non plus un poste d’infrastructure générique : vous connaissez les solutions que vous déployez, vous parlez à ceux qui les utilisent, et vous êtes co-responsable de leur bon fonctionnement.

3. Activités détaillées

Les éléments ci-dessous sont donnés à titre illustratif et non limitatif. Selon les projets, le poste mobilise tout ou partie de ces domaines ; il n’est pas attendu qu’un candidat les maîtrise tous.

3.1 Plateforme cloud et hybride

  • Construction et exploitation du socle cloud : découpage des environnements, réseau (endpoints privés, peering), gestion des identités et des droits, secrets, chiffrement

  • Arbitrage entre services managés et composants auto-hébergés, sous la contrainte de devoir également fonctionner en datacenter interne et sur site

  • Connexions sécurisées entre cloud, datacenter interne et sites : enclaves, zones de transit, data diode ou passerelle applicative – conçues avec l’architecture groupe, mais opérées et adaptées à nos usages data de notre côté

  • Fonctionnement en mode dégradé : réplication et cache local, files d’attente, reprise propre lorsque le lien tombe puis revient

  • Infrastructure as Code : reproductibilité des environnements d’un site à l’autre, un déploiement sur une nouvelle usine devant être un paramétrage et non un projet

  • Gestion des ressources de calcul : dimensionnement, mutualisation et ordonnancement des GPU et CPU d’entraînement (file d’attente, quotas par projet)

  • Maîtrise des coûts : visibilité par projet et par usage, dimensionnement, recours aux instances préemptibles ou réservées pour les charges d’entraînement

  • Interlocuteur technique des équipes IT groupe et des équipes automatisme / OT des sites sur les sujets réseau, sécurité et hébergement

3.2 Déploiement, orchestration et scalabilité

  • Orchestration de type Kubernetes permettant d’ajouter des conteneurs au fil de l’augmentation du nombre d’équipements instrumentés sur un site, sans réarchitecturer

  • Prise en compte des contraintes edge et OT : ressources limitées, connectivité non garantie, redémarrages, coexistence avec les systèmes de conduite

  • Standardisation des composants de déploiement – charts, templates, paramétrage par site – pour que l’ouverture d’un nouveau site ou d’un nouveau client mobilise le minimum de spécifique

  • Gestion de flotte : propager une mise à jour sur plusieurs sites de façon contrôlée, et savoir à tout moment dans quel état se trouve chacun d’eux

  • Contribution aux déploiements chez des clients externes, avec les contraintes d’exploitation et de support associées

    3.3 Industrialisation des modèles en production

  • Chaînes d’intégration et de déploiement dédiées au ML : tests automatisés sur les données et sur les modèles (conformité de schéma, plages de valeurs, performance minimale, non-régression), packaging, promotion entre environnements d’intégration et de production

  • Versioning et gestion des rollbacks : savoir à tout moment quelle version tourne sur quel équipement, et pouvoir revenir en quelques minutes au modèle précédent sur un site donné

  • Stratégies de déploiement progressif : shadow mode (le modèle tourne sans agir), canary sur un site pilote, A/B entre deux versions – indispensable sur les solutions d’optimisation temps réel (RTO) et de commande prédictive (MPC), où une mauvaise consigne a un coût procédé réel

  • Registry unifié et lineage de bout en bout : modèles, jeux de données, features et images de conteneurs, avec la synchronisation on-premise ↔ cloud ; pour une prédiction donnée en production, pouvoir remonter au modèle, aux données d’entraînement, au code et aux hyperparamètres – prérequis pour le diagnostic comme pour l’audit interne et l’AI Act

  • Automatisation du réentraînement : orchestration des déclencheurs (dérive, calendrier, nouvelle campagne de données), choix du lieu d’exécution (edge, datacenter, cloud) et chemin de retour du modèle réentraîné vers les systèmes de terrain, dans le respect de la ségrégation IT/OT. Le contenu du réentraînement reste la main des data scientists ; vous en construisez et en opérez la mécanique

  • Suivi d’expérimentations mutualisé (MLflow ou équivalent) et cycle de vie des artefacts : hébergement, sauvegarde, droits d’accès, conventions de nommage, rétention, promotion entre états

3.4 Exploitation, fiabilité et sécurité

  • Niveaux de service définis et tenus avec les sites : disponibilité, fraîcheur des prédictions, délai de rétablissement – et la discussion des arbitrages que cela implique

  • Gestion des incidents : détection, qualification, escalade, communication vers les sites, puis post-mortems sans recherche de coupable et corrections effectivement mises en œuvre

  • Runbooks et automatisation des gestes d’exploitation récurrents, avec l’objectif que la charge d’exploitation croisse moins vite que le nombre de sites

  • Sauvegarde, restauration et reprise après incident : testées, pas seulement documentées

  • Sécurité opérationnelle : vulnérabilités des images, application des correctifs, rotation des secrets, revue périodique des accès

  • Gestion de la capacité et des coûts dans la durée, à mesure que le nombre de sites et de modèles en service augmente

4. Environnement de travail, conditions et avantages

Vos conditions de travail

  • Contrat : CDI cadre, basé à Lyon 7e

  • Télétravail : 2 jours flexibles par semaine, en journées complètes et/ou demi-journées

  • Déplacements : ponctuels, en France et à l’international, sur les sites du groupe ou chez nos clients

  • Rémunération : selon expérience

  • Formation : accompagnement du développement des compétences, avec des formations proposées régulièrement

  • Cohésion : événements d’équipe et culture privilégiant l’autonomie

Vos avantages

  • Mutuelle Alan premium, 100 % digitale : téléconsultation 7j/7 et remboursements rapides

  • Tickets restaurant de 10 €, pris en charge à 60 % par l’employeur

Exigences du poste

Stack technique :

GrafanaLinux AdministrationGitLab CIKubernetesGitAnsibleTerraformGitHub ActionsArgoCDHelmLokiAWSDockerPythonPrometheus

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

À propos de l'entreprise

Voir toutes les offres de le1817

Publié par

Recruteur
Recruteur

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.