OmDev Logo
GetYourJob
0
Publié il y a 80 jours

Tech lead Expert Data Retrieval RAG - Freelance

Entreprise
Localisation
92400 Courbevoie, France
Hybride
Type de contrat
Freelance
Niveau
Top profil

Salaire du marché

Médiane du marché
600€/j
Estimation
525€/jfourchette habituelle650€/j

Cette offre n'affiche pas de salaire. D'après 37 offres pour ce poste (Top profil, Île-de-France), le marché se situe autour de 600€/j (525€/j–650€/j).

0vues
0clics

Description du poste

Contexte

Pré embauche - 6 mois de mission maximum

Aux côtés d’une équipe d’experts passionnés au sein de l’équipe “AI Service”, vous relèverez les plus hauts défis techniques de la société et du marché de l’édition juridique. En tant qu’Expert Data & Retrieval, vous êtes le garant de la matière première de notre IA : la collecte, l’ingestion, l’indexation et la recherche de pertinence sur des volumes juridiques massifs, le socle qui alimente nos modèles de langage et nos produits. Votre terrain de jeu : transformer la manière dont tout un secteur, le droit, travaille au quotidien.

Votre mission n'est pas d'écrire un simple script, mais de concevoir des pipelines de données robustes capables d'ingérer, de nettoyer et d'indexer d'énormes corpus juridiques, puis d'exposer une recherche rapide et pertinente (sémantique et hybride) au service de plusieurs équipes à travers l'Europe. Vous garantirez la fraîcheur des index et la qualité du retrieval tout en gérant une complexité technique de haut vol (volumétrie, hétérogénéité des sources, évaluation de la pertinence, scalabilité…).

Missions

  • Concevoir des pipelines d'ingestion pour la collecte et le traitement de sources hétérogènes (édition, open data, bases juridiques), incluant parsing, nettoyage, chunking et normalisation des documents.

  • Choisir et industrialiser les modèles d'embeddings, alimenter et maintenir les bases vectorielles, gérer la fraîcheur et la reconstruction des index.

  • Garantir la scalabilité de l'indexation sur des corpus massifs et assurer la traçabilité des données (lignage, versioning des index).

  • Développer une stratégie de retrieval combinant recherche lexicale et sémantique (BM25 + embeddings) avec reranking et filtrage par métadonnées pour maximiser la pertinence.

  • Mettre en place des jeux de tests et des métriques de pertinence (recall, precision, nDCG, MRR) pour mesurer et améliorer le retrieval.

  • Structurer la phase de récupération qui alimente les LLM (contexte, citations, dé-duplication, gestion des fenêtres de contexte).

  • Instrumenter les pipelines (logs, métriques, traces de qualité) et garantir la sécurité et la conformité des données juridiques (RGPD, cloisonnement par pays).

  • Promouvoir les pratiques de Clean Code, SOLID, et tests automatisés.

  • Assurer une veille constante et contribuer au rayonnement technique du groupe (articles, meetups, open-source).

Outils & Environnement

  • Langages : Python 3.11+ (maîtrise requise), Go.

  • Indexation : bases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25.

  • Embeddings & NLP : sentence-transformers, modèles d'embeddings, tokenisation, parsing de documents.

  • RAG & LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock.

  • Data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, Kubernetes.

  • Tests : Pytest ; évaluation de la pertinence (recall, nDCG, MRR).

Conditions de travail

  • Type de contrat : Pré embauche, mission de 6 mois maximum.

  • Rémunération : Fourchette à définir.

  • Lieu :La Défense, France : Lefebvre Dalloz

  • Début : 01/09/2026

Exigences du poste

Stack technique :

NLP Natural Language ProcessingData EngineeringPythonPostgreSQLInformation RetrievalVector DatabasesHybrid SearchRAG

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

À propos de l'entreprise

Voir toutes les offres de Salutech

Publié par

Recruteur
Recruteur

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.