Cette offre n'affiche pas de salaire. D'après 16 offres pour ce poste (Top profil, Paris), le marché se situe autour de 62k€ (60k€–65k€).
Le besoin
Le contexte
Rejoignez une aventure data au coeur de la Legaltech : notre client construit le moteur de recherche et d'indexation qui donnera accès, demain, à un patrimoine juridique massif et hétérogène pour plusieurs équipes à travers l'Europe.
Votre mission n'est pas d'écrire un simple script : c'est de concevoir des pipelines de données robustes, capables d'ingérer, nettoyer et indexer d'énormes corpus juridiques, puis d'exposer une recherche rapide, pertinente et hybride (sémantique + lexicale) à grande échelle.
Vos missions au quotidien
1. Collecte, ingestion & indexation
Concevoir des pipelines d'ingestion sur des sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation.
Choisir et industrialiser les modèles d'embeddings, alimenter et maintenir les bases vectorielles.
Garantir la fraîcheur des index, la scalabilité sur des volumétries massives et la traçabilité (lignage, versioning).
2. Recherche & pertinence (Retrieval)
Combiner recherche lexicale et sémantique (BM25 + embeddings), reranking et filtrage par métadonnées.
Mettre en place des métriques de pertinence (recall, precision, nDCG, MRR) et les faire vivre dans le temps.
Structurer la phase de retrieval qui alimente les LLM (RAG : contexte, citations, dé-duplication, gestion des fenêtres de contexte).
Instrumenter les pipelines (logs, métriques, traces qualité) et garantir la sécurité/conformité des données (RGPD, cloisonnement par pays).
3. Leadership technique & gouvernance
Promouvoir une culture Clean Code, SOLID et tests automatisés.
Contribuer au rayonnement technique du groupe (articles, meetups, open-source).
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.