Mission pré-embauche : jusqu’à 6 mois
Nous recherchons un Expert Data & Retrieval pour rejoindre l’équipe AI Service et contribuer à un projet stratégique : construire le socle data et retrieval qui alimentera les futures solutions IA du groupe dans le domaine juridique.
Votre rôle : transformer des corpus juridiques massifs, complexes et hétérogènes en une recherche rapide, fiable, pertinente et exploitable par les LLM.
Vous ne viendrez pas écrire “un script de plus”.
Vous concevrez des pipelines robustes pour collecter, nettoyer, indexer et rendre accessibles de grands volumes de contenus juridiques à travers l’Europe.
Vous interviendrez sur les sujets clés :
📥 Ingestion & traitement de données : collecte de sources juridiques variées, parsing, nettoyage, normalisation, chunking.
🧠 Indexation & embeddings : choix des modèles, vectorisation, bases vectorielles, versioning et fraîcheur des index.
🔎 Recherche hybride : combinaison BM25 + embeddings, reranking, filtres par métadonnées, optimisation de la pertinence.
📊 Évaluation continue : mise en place de jeux de tests et de métriques comme recall, precision, nDCG, MRR.
🧩 RAG & LLM : structuration du contexte, citations, déduplication, gestion des fenêtres de contexte.
🛡️ Observability & sécurité : logs, métriques, traçabilité, conformité RGPD, cloisonnement par pays.
🤝 Leadership technique : challenger la stack, transmettre les bonnes pratiques, accompagner les équipes.
Langages : Python 3.11+, Go apprécié.
Search & indexation : OpenSearch, pgvector, Qdrant, Weaviate, BM25, recherche hybride.
Embeddings & NLP : sentence-transformers, tokenisation, parsing documentaire.
RAG & LLM : LangChain, OpenAI, Mistral, Bedrock, reranking.
Data & infra : PostgreSQL, Airflow, Spark, Kafka, Redis, Docker, CI/CD, Kubernetes.
Qualité : Pytest, tests automatisés, métriques de pertinence, versioning des datasets et index.
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.