OmDev Logo
GetYourJob
0
Publié il y a 13 jours

Tech Lead Expert Data Retrieval & RAG LegalTech - Pré embauche - client final - Freelance (H/F)

Entreprise
Collective workPlateforme freelance
Localisation
Paris
Hybride
Type de contrat
Freelance
Niveau
Junior
0vues
0clics

Description du poste

Taux journalier (TJM): 800
Tech lead Expert Data Retrieval RAG. PRE EMBAUCHE - 6 mois de mission maximum.
Au sein de l'équipe "AI Service", vous contribuerez à la conception de pipelines d'ingestion, d'indexation et de recherche pour des corpus juridiques massifs.
Enjeu : garantir la fraîcheur et la qualité du retrieval (sémantique et hybride) pour des équipes réparties en Europe, en respectant la sécurité et la conformité des données (RGPD, cloisonnement par pays).
* Collecte, ingestion & indexation : concevoir des pipelines pour sources hétérogènes (parsing, nettoyage, chunking, normalisation), industrialiser modèles d'embeddings, alimenter et maintenir bases vectorielles, gérer fraîcheur et reconstruction des index, garantir scalabilité et traçabilité (lignage, versioning).
* Recherche & pertinence (Retrieval) : piloter stratégie combinant recherche lexicale et sémantique (BM25 + embeddings), reranking et filtrage par métadonnées ; structurer la phase de récupération pour alimenter les LLM (contexte, citations, dé-duplication, gestion des fenêtres de contexte) ; mettre en place jeux de tests et métriques (recall, precision, nDCG, MRR) ; instrumenter pipelines (logs, métriques, traces de qualité) et garantir observability et security.
* Leadership technique & gouvernance : promouvoir Clean Code, SOLID, tests automatisés ; assurer veille, documentation et rayonnement technique (articles, meetups, open-source).
Livrables : pipelines reproductibles, index robustes et métriques de pertinence opérationnelles.
* Langages : Python 3.11+ (maîtrise requise), Go
* Indexation : bases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25
* Embeddings & NLP : sentence-transformers, modèles d'embeddings, tokenisation, parsing de documents
* RAG & LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock
* Data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8S
* Tests : Pytest ; évaluation de la pertinence (recall, nDCG, MRR)
* Pré embauche
* Mission de 6 mois maximum
* Contexte européen avec équipes réparties en Europe
* Respect des normes RGPD et cloisonnement par pays



Abonnez-vous à la page NaxoTech sur LinkedIn pour découvrir nos offres régulières :
https://www.linkedin.com/company/naxotech (https://www.linkedin.com/company/naxotech)
1. Master, PhD, ou équivalent
2. Maîtrise de Python 3.11+ et connaissance de Go
3. Expérience avec des bases vectorielles telles que pgvector, Weaviate, Qdrant, OpenSearch et recherche hybride / BM25
4. Compétences en embeddings et NLP : sentence-transformers, modèles d'embeddings, tokenisation, parsing de documents
5. Connaissance des outils RAG et LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock
6. Compétences en data & infrastructure : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8S
7. Maîtrise des tests avec Pytest et évaluation de la pertinence (recall, nDCG, MRR)
8. Expérience avérée en data engineering / information retrieval en production
9. Expertise en retrieval, pipelines reproductibles, culture IA/ML
10. Anglais fluide (contexte européen quotidien)
11. Qualités personnelles : vision produit, pédagogie, rigueur sécurité, curiosité innovation, communication claire

Exigences du poste

Stack technique :

PythonGoPostgreSQLRedisDockerLLMOpenAI APILangChainArtificial IntelligenceRAGPytestSolid.jsKubernetesHugging FaceMistral AIVector Database

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

À propos de l'entreprise

Collective workPlateforme freelance
Voir toutes les offres de Collective work

Publié par

Recruteur
Recruteur

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.