Cette offre n'affiche pas de salaire. D'après 18 offres pour ce poste (Senior, Île-de-France), le marché se situe autour de 525€/j (475€/j–555€/j).
LE CONTEXTE
Rejoignez une aventure data au cœur de la Legaltech : notre client construit le moteur de recherche et d'indexation qui donnera accès, demain, à un patrimoine juridique massif et hétérogène pour plusieurs équipes à travers l'Europe.
Votre mission n'est pas d'écrire un simple script : c'est de concevoir des pipelines de données robustes, capables d'ingérer, nettoyer et indexer d'énormes corpus juridiques, puis d'exposer une recherche rapide, pertinente et hybride (sémantique lexicale) à grande échelle.
VOS MISSIONS AU QUOTIDIEN
Concevoir des pipelines d'ingestion sur des sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation.
Choisir et industrialiser les modèles d'embeddings, alimenter et maintenir les bases vectorielles.
Recherche \& pertinence (Retrieval)
Combiner recherche lexicale et sémantique (BM25 embeddings), reranking et filtrage par métadonnées.
Mettre en place des métriques de pertinence (recall, precision, nDCG, MRR) et les faire vivre dans le temps.
Structurer la phase de retrieval qui alimente les LLM (RAG : contexte, citations, dé-duplication, gestion des fenêtres de contexte).
Leadership technique \& gouvernance
Promouvoir une culture Clean Code, SOLID et tests automatisés.
FORMATION
Master, PhD ou équivalent.
COMPÉTENCES ATTENDUES
Expérience avérée en data engineering / information retrieval sur des volumes massifs en production.
Expertise Retrieval confirmée : indexation, embeddings, recherche hybride - et capacité à mesurer puis améliorer la pertinence.
Culture Data forte : pipelines reproductibles, qualité et lignage des données, versioning des datasets/index.
Solide culture IA / ML (embeddings, NLP, bonne compréhension des LLM, sans nécessairement en être l'expert serving).
Un plus : appétence pour d'autres langages (notamment Java) pour des sujets transverses.
SOFT SKILLS
Vision produit : vos index et votre moteur de recherche sont gérés comme un produit ; les autres développeurs sont vos clients.
Leadership technique \& pédagogie : capacité à évangéliser les bonnes pratiques data/retrieval/IA.
Obsession de la qualité : rigueur absolue sur la sécurité des données (Legaltech oblige) et la fiabilité des services.
Esprit d'innovation : curiosité pour les avancées IA, NLP et data.
Communication : savoir vulgariser des concepts complexes.
Python 3.11 (maîtrise requise), GoIndexationBases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25Embeddings \& NLPsentence-transformers, modèles d'embeddings, tokenisation, parsing de documentsRAG \& LLMLangChain, RAG, reranking, OpenAI, Mistral, BedrockData \& infraPostgreSQL, Airflow / Spark, Kafka, Redis, Docker, CI/CD, K8sTests \& qualitéPytest, évaluation de pertinence (recall, nDCG, MRR)
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.