Cette offre n'affiche pas de salaire. D'après 19 offres pour ce poste (Top profil, Paris), le marché se situe autour de 73k€ (65k€–85k€).
Salaire du marché pour Tech Lead (Top profil) à Paris : médiane 72 500 €/an, P25–P75 : 65 000–85 000 €/an, n = 19 offres.
Baromètre TJM et salaires ITLe besoin
Contexte
PRE EMBAUCHE - 6 mois de mission maximum. Aux côtés d'une équipe d'experts au sein d'un pôle AI, vous serez responsable de la collecte, de l'ingestion, de l'indexation et de la recherche de pertinence sur des volumes juridiques massifs pour alimenter des modèles de langage et des produits. Enjeu : garantir la fraîcheur des index, la qualité du retrieval et la scalabilité face à une volumétrie et une hétérogénéité de sources importantes. Localisation : Europe.
Missions
Concevoir des pipelines d'ingestion pour sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation.
Indexation & embeddings : choisir et industrialiser les modèles d'embeddings, maintenir les bases vectorielles, gérer la fraîcheur et la reconstruction des index.
Assurer scalabilité, traçabilité des données (lignage, versioning des index).
Définir stratégie de retrieval : combiner recherche lexicale et sémantique (BM25 + embeddings) avec reranking et filtrage par métadonnées.
Mettre en place évaluation continue : jeux de tests et métriques (recall, precision, nDCG, MRR).
Structurer la phase de récupération pour alimenter les LLM (contexte, citations, dé-duplication, gestion des fenêtres de contexte).
Instrumenter les pipelines (logs, métriques, traces de qualité) et garantir sécurité et conformité des données (RGPD, cloisonnement par pays).
Promouvoir pratiques de Clean Code, SOLID, tests automatisés.
Contribuer au rayonnement technique (articles, meetups, open-source) et assurer transfert de compétences.
Outils & Environnement
Langages : Python 3.11+ (maîtrise requise), Go.
Indexation : bases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25.
Embeddings & NLP : sentence-transformers, modèles d'embeddings, tokenisation, parsing de documents.
RAG & LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock.
Data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8S.
Tests : Pytest ; évaluation de la pertinence (recall, nDCG, MRR).
Conditions de travail
Mission pré-embauche de 6 mois maximum.
Localisation : Europe.
Contexte européen avec anglais fluide requis.
Abonnez-vous à la page NaxoTech sur LinkedIn pour découvrir nos offres régulières :
👉
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.