Cette offre n'affiche pas de salaire. D'après 23 offres pour ce poste (tous niveaux, Paris), le marché se situe autour de 550€/j (499€/j–625€/j).
Contexte
Grand groupe pharmaceutique international qui fait évoluer sa plateforme GenAI interne pour automatiser et fiabiliser la production documentaire à grande échelle. Dans un environnement fortement réglementé, l'enjeu est de construire des fondations data robustes et scalables pour alimenter les workflows d'intelligence artificielle en production.
Missions
Parsing & ingestion : développer et maintenir des parsers multi-formats (DOCX avec styles, tables et track changes ; Excel avec cellules fusionnées, multi-feuilles et formules)
Modèle de données intermédiaire : définir un format normalisé post-parsing, compatible avec les workflows Data Science en aval
Traçabilité & qualité des données : implémenter la traçabilité source à travers les pipelines d'ingestion ; assurer les contrôles de complétude (doublons, métadonnées manquantes, cohérence)
CI/CD & déploiement : concevoir et déployer des pipelines CI/CD via Terraform ; mettre en place des smoke tests et workflows de validation post-ingestion
Stack & compétences attendues
Python avancé, notamment sur le parsing documentaire (DOCX, Excel)
Data pipelines, CI/CD et infrastructure cloud (AWS, Terraform)
Qualité des données, robustesse et scalabilité
Interface régulière avec des équipes Data Science
Modalités
Démarrage : dès que possible
Localisation : Paris – 3j/semaine sur site
TJM : selon profil
Durée : mission longue durée
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.