Mission – Data Scientist spécialisé dans l’évaluation des LLMs
Contexte et objectif de la mission
Dans le cadre du développement et de l’encadrement des usages de l’Intelligence Artificielle générative au sein d’un groupe bancaire, la mission vise à renforcer les capacités d’évaluation, de qualification et de sécurisation des LLM. Ces modèles sont destinés à différents cas d’usage métiers, notamment l’assistance aux collaborateurs, l’analyse documentaire, la génération de contenus, l’aide à la décision, l’automatisation de processus et l’exploitation de bases de connaissances internes.
L’adoption des LLM nécessite un cadre rigoureux afin de garantir la performance, la robustesse, la sécurité, la conformité et l’adéquation aux exigences du secteur bancaire. La mission consiste à intervenir en tant que Data Scientist spécialisé dans l’évaluation des LLM afin de définir et mettre en œuvre des méthodologies d’évaluation, de benchmark et de red teaming des modèles d’IA générative utilisés, testés ou envisagés.
Cette mission s’inscrit dans une démarche de gouvernance des modèles IA, de maîtrise des risques liés à l’IA générative et d’industrialisation des pratiques d’évaluation avant mise en production.
Objectifs principaux
• Définir et mettre en œuvre un cadre d’évaluation des LLM adapté aux enjeux bancaires
• Évaluer les performances, limites, risques et comportements des modèles d’IA générative
• Réaliser des benchmarks comparatifs entre différents LLM, qu’ils soient internes, open source ou fournis par des éditeurs
• Concevoir et exécuter des campagnes de red teaming pour identifier les vulnérabilités, biais, hallucinations et comportements indésirables
• Contribuer à la sélection, la validation et la qualification des modèles LLM avant usage ou mise en production
• Produire des analyses objectives pour éclairer les décisions métiers, techniques, risques et conformité
• Participer à l’industrialisation des processus d’évaluation des LLM dans le cycle de vie des modèles IA
• Contribuer à la constitution de jeux de tests, métriques, référentiels d’évaluation et outils de suivi
Missions principales
Évaluation des LLM
• Définir les protocoles d’évaluation adaptés aux cas d’usage d’IA générative
• Identifier les métriques pertinentes pour mesurer la qualité des réponses générées : exactitude, pertinence, cohérence, complétude, factualité, robustesse, sécurité, explicabilité et conformité
• Évaluer les capacités des modèles sur différents types de tâches : résumé, extraction d’information, classification, question-réponse, génération de texte, analyse documentaire, raisonnement, traduction et reformulation
• Mettre en place des jeux de tests représentatifs des usages métiers bancaires
• Analyser les performances des modèles selon différents contextes, langues, domaines métiers et niveaux de complexité
• Identifier les limites fonctionnelles et techniques des modèles testés
• Documenter les résultats d’évaluation et formuler des recommandations
Benchmark LLM
• Concevoir et conduire des benchmarks comparatifs entre plusieurs modèles LLM
• Comparer les modèles selon des critères de performance, coût, latence, robustesse, sécurité, empreinte technique et conformité
• Tester différents modèles propriétaires, open source ou internes selon les contraintes du groupe
• Mettre en place des grilles d’analyse pour aider au choix des modèles selon les cas d’usage
• Évaluer l’impact de différents paramètres : prompt, température, taille de contexte, modèle d’embedding, architecture RAG, fine-tuning et quantization
• Produire des rapports de benchmark exploitables par les équipes métiers, data, IT, sécurité et conformité
• Participer à la définition de standards internes pour la comparaison et la qualification des LLM
Red teaming et sécurité des LLM
• Définir et exécuter des scénarios de red teaming adaptés aux risques liés à l’IA générative
• Tester la résistance des modèles face aux attaques de type prompt injection, jailbreak, data leakage, contournement de garde-fous, génération de contenu inapproprié ou non conforme
• Identifier les risques d’hallucination, de biais, de toxicité, de désinformation ou de réponses dangereuses
• Concevoir des corpus de prompts adversariaux adaptés aux contextes bancaires et réglementaires
• Évaluer la capacité des modèles à respecter les politiques internes, les règles de conformité et les contraintes de sécurité
• Analyser les vulnérabilités détectées et proposer des mesures de mitigation
• Collaborer avec les équipes sécurité, conformité, risques et architecture pour renforcer le cadre d’usage des LLM
Méthodologie, outillage et industrialisation
• Mettre en place des outils, notebooks, scripts ou pipelines d’évaluation automatisée
• Contribuer à l’industrialisation des campagnes d’évaluation dans le cycle de vie des modèles
• Définir des référentiels de métriques et de seuils d’acceptabilité
• Construire et maintenir des datasets d’évaluation internes, anonymisés et représentatifs
• Participer à l’intégration des résultats d’évaluation dans des outils de gouvernance des modèles IA
• Assurer la traçabilité des campagnes d’évaluation, des versions de modèles et des résultats obtenus
• Mettre en place des tableaux de bord ou rapports de suivi de la qualité des LLM
• Contribuer à la veille technologique sur les méthodes d’évaluation, frameworks de benchmark et pratiques de red teaming LLM
Collaboration et accompagnement
• Travailler avec les équipes data science, MLOps, métiers, risques, conformité, sécurité et IT
• Accompagner les équipes projets dans l’évaluation de leurs cas d’usage d’IA générative
• Participer à la définition des critères de go/no-go avant mise en production d’un modèle LLM
• Présenter les résultats d’évaluation aux parties prenantes
• Contribuer aux bonnes pratiques internes d’usage, de test et de validation des LLM
• Participer aux comités de validation ou de gouvernance IA lorsque nécessaire
Profil recherché
Le poste cible un Data Scientist spécialisé dans l’évaluation des LLM, avec une intervention centrée sur l’IA générative, l’évaluation de modèles, le benchmark, le red teaming, la sécurité, la conformité et l’industrialisation des pratiques d’évaluation dans un environnement bancaire.
Livrables attendus
• Cadre méthodologique d’évaluation des LLM adapté aux usages bancaires
• Protocoles de test et grilles d’évaluation des modèles d’IA générative
• Jeux de tests et datasets d’évaluation documentés
• Corpus de prompts de benchmark et de red teaming
• Rapports d’évaluation des LLM testés
• Rapports de benchmark comparatif entre modèles
• Analyses de risques liées aux comportements des LLM
• Synthèses des vulnérabilités identifiées lors des campagnes de red teaming
• Recommandations de mitigation et plans d’amélioration
• Tableaux de bord ou indicateurs de suivi de performance et de sécurité
• Scripts, notebooks ou pipelines d’évaluation automatisée
• Documentation des métriques, seuils et critères de validation
• Recommandations pour la sélection et la mise en production des modèles
• Contributions à l’intégration des résultats d’évaluation dans des outils de gouvernance IA
• Supports de présentation à destination des équipes métiers, techniques, risques et conformité
Évaluation de LLM, Benchmark de modèles IA générative, Red teaming et sécurité des LLM, IA générative, Industrialisation des processus d’évaluation, Conformité et gestion des risques en environnement bancaire
Mission similaire en secteur bancaire
2 jours de présence sur site par semaine (mais flexible dans l'équipe)
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.