Cette offre n'affiche pas de salaire. D'après 39 offres pour ce poste (Senior, Île-de-France), le marché se situe autour de 480€/j (445€/j–550€/j).
Durée : 16 à 20 semaines
Concevoir et industrialiser la chaîne d’ingestion, de normalisation et de structuration de données externes dans le cadre d’une solution Data & IA de collecte et d’analyse de données multi-sources.
Garantir :
la qualité des données
la robustesse des pipelines
la traçabilité des traitements
l’exploitabilité des flux pour les briques analytiques
Responsable du socle pipeline Data
Prise en charge de :
la collecte des sources externes
le parsing documentaire
la normalisation et structuration des données
l’exposition des données vers les modules d’analyse (NLP / IA)
5 à 10 ans d’expérience
Forte autonomie
Expérience sur données non structurées (documents, web, PDF, etc.)
Capacité à délivrer rapidement sans compromettre la robustesse
Développer des pipelines d’ingestion automatisés
Concevoir et implémenter des connecteurs vers des sources externes
Gérer le parsing documentaire (découpage, nettoyage, structuration)
Mettre en place des mécanismes de déduplication et de contrôle qualité
Concevoir les modèles de données intermédiaires et normalisés
Collaborer avec les équipes IA/NLP pour rendre les données exploitables
Participer aux tests, à la documentation et à la fiabilité des traitements
Python avancé
Conception de pipelines de données et orchestration
APIs, scraping raisonné, parsing documentaire (PDF, HTML…)
SQL et modélisation de données
PostgreSQL
Culture forte de :
qualité de données
logs et monitoring
tests et industrialisation
Gestion des problématiques :
volumétrie
erreurs
reprise sur incident
supervision
Airflow, Prefect ou équivalent
Librairies de parsing documentaire (PyMuPDF, pdfplumber, OCR…)
Elasticsearch, indexation, moteur de recherche
Bases vectorielles (pgvector ou équivalent)
Docker, GitLab CI/CD
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.