Contexte
Au sein d’une équipe spécialisée en Data et Intelligence Artificielle, vous intervenez sur des problématiques à forte dimension technique autour de la gestion de données, de l’Information Retrieval et de l’IA générative.
Missions
- Concevoir et industrialiser les pipelines permettant de collecter, transformer, indexer et rechercher de grands volumes de données, afin d’alimenter des applications basées sur les LLM et les architectures RAG.
- Participer aux choix d’architecture, à l’amélioration de la pertinence des recherches et à l’industrialisation des solutions en production.
Data Engineering & Indexation
- Concevoir et industrialiser des pipelines d’ingestion de données provenant de sources hétérogènes.
- Mettre en œuvre les traitements de parsing, nettoyage, normalisation et chunking.
- Concevoir et maintenir des systèmes d’indexation à grande échelle.
- Mettre en œuvre des bases vectorielles et des embeddings.
- Garantir la qualité, la fraîcheur, la traçabilité et la scalabilité des données et des index.
Retrieval & RAG
- Concevoir des stratégies de recherche sémantique et hybride.
- Combiner recherche lexicale (BM25), embeddings, filtrage et reranking.
- Mettre en place des indicateurs de pertinence : Recall, Precision, nDCG, MRR.
- Optimiser les mécanismes de Retrieval alimentant les LLM et architectures RAG.
- Travailler sur la gestion du contexte, la déduplication et la qualité des résultats.
Architecture & qualité
- Participer aux choix techniques et à l’évolution de la stack Data/IA.
- Mettre en place les bonnes pratiques de développement : Clean Code, SOLID, tests automatisés.
- Assurer l’observabilité des pipelines et des services.
- Contribuer à la sécurité et à la conformité des données.
- Accompagner techniquement les équipes et partager les bonnes pratiques.
Environnement technique
Indispensable :
- Python 3.11+
- Data Engineering / Information Retrieval
- Embeddings / NLP
- Recherche sémantique et hybride
- RAG / LLM
- Bases vectorielles : Qdrant, Weaviate, pgvector, OpenSearch
- PostgreSQL
- Tests avec Pytest
Environnement apprécié :
- LangChain
- OpenAI, Mistral, Amazon Bedrock
- BM25 / reranking
- Kafka
- Redis
- Airflow / Spark
- Docker / Kubernetes
- CI/CD
- Go ou Java
Conditions de travail
- Lieu de la mission : Paris
- 2 jours de télétravail par semaine
- Date de démarrage : ASAP
- Mission de longue durée