Cette offre n'affiche pas de salaire. D'après 37 offres pour ce poste (Top profil, Île-de-France), le marché se situe autour de 600€/j (525€/j–650€/j).
Nous recherchons un(e) Expert(e) Data & Information Retrieval pour rejoindre l’équipe AI Service d’un acteur majeur des services numériques et de l’information professionnelle.
Important : cette opportunité s’inscrit dans le cadre d’une préembauche, avec une mission de transition de six mois maximum avant intégration en CDI.
Vous participerez à la construction du socle Data et Retrieval alimentant plusieurs produits d’intelligence artificielle à l’échelle européenne.
Votre rôle sera de concevoir et d’industrialiser des pipelines capables de collecter, nettoyer, structurer et indexer d’importants corpus documentaires, puis d’exposer une recherche rapide et pertinente combinant recherche lexicale et sémantique.
Vous interviendrez à un moment structurant du projet et pourrez challenger les choix technologiques ainsi que l’architecture cible.
Concevoir les pipelines de collecte, parsing, nettoyage, chunking et normalisation de documents.
Industrialiser la génération d’embeddings et l’alimentation des bases vectorielles.
Garantir la fraîcheur, la traçabilité et le versioning des corpus et des index.
Combiner recherche lexicale et sémantique : BM25, embeddings, filtres et reranking.
Structurer la phase de retrieval alimentant les LLM : contexte, citations, déduplication et fenêtres de contexte.
Construire des jeux de tests et mesurer la pertinence avec des métriques comme recall, precision, nDCG et MRR.
Assurer la scalabilité, l’observabilité et la sécurité des pipelines.
Promouvoir les bonnes pratiques de développement, les tests automatisés et la qualité du code.
Accompagner les équipes et transmettre votre expertise Data, Search et IA.
Expérience confirmée en Data Engineering et Information Retrieval sur des systèmes en production.
Très bonne maîtrise de Python.
Expertise en indexation, embeddings et recherche hybride.
Expérience des corpus documentaires volumineux et hétérogènes.
Capacité à mesurer, analyser et améliorer la pertinence d’un moteur de recherche.
Connaissance des architectures RAG et bonne compréhension des LLM.
Expérience des pipelines reproductibles, de la qualité des données, du lineage et du versioning.
Capacité à challenger une architecture et à exercer un leadership technique.
Anglais courant, dans un contexte européen quotidien.
Volonté de rejoindre durablement l’entreprise à l’issue de la mission.
Python 3.11+, Go et éventuellement Java.
PostgreSQL, pgvector, Weaviate, Qdrant ou OpenSearch.
BM25, embeddings, sentence-transformers et reranking.
LangChain, OpenAI, Mistral ou AWS Bedrock.
Airflow, Spark, Kafka, Redis.
Docker, Kubernetes et CI/CD.
Pytest et outils d’évaluation du retrieval.
La stack reste ouverte : nous recherchons une personne capable de recommander les solutions les plus adaptées, pas simplement d’appliquer des choix déjà établis.
Participer à des décisions d’architecture structurantes.
Construire un socle utilisé par plusieurs produits et équipes européennes.
Travailler sur des corpus documentaires massifs et à forte valeur métier.
Industrialiser des usages IA avec de véritables exigences de pertinence, de traçabilité et de sécurité.
Intégrer durablement une équipe d’experts spécialisée dans l’IA.
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.