OmDev Logo
GetYourJob
0
Publié il y a 84 jours

Toulouse - Expertise technique IA pour Equipe SOC - Freelance

Entreprise
Localisation
Toulouse, France
Hybride
Type de contrat
Freelance
Niveau
Rémunération
400ۥ Taux journalier

Salaire du marché

Médiane du marché
585€/j
Sous le marché
465€/jfourchette habituelle640€/j
Cette offre : 400€/j

Basé sur 105 offres pour ce poste (tous niveaux, France, 3 dernières semaines). Fourchette habituelle 465€/j–640€/j, médiane 585€/j. Cette offre (400€/j) est sous la fourchette.

0vues
0clics

Description du poste

Taux journalier (TJM): 400

Contexte

Au sein de notre SOC, nous intégrons des technologies d'Intelligence Artificielle Générative pour automatiser l'analyse de menaces, contextualiser les alertes de sécurité et assister nos analystes. Nous recherchons un(e) Expert(e) en IA spécialisé(e) dans l'entraînement, l'alignement et l'évaluation de Modèles de Langage (LLM/SLM) afin de concevoir des modèles souverains, ultra-spécialisés en cybersécurité.

En collaboration directe avec l'équipe R&D Cyber et l'équipe SOC, le/la consultant(e) aura pour missions de :

Missions

  • Fine-tuning de modèles : adapter et spécialiser des LLM open-source (Llama, Mistral, Qwen...) sur des données de cybersécurité (logs, rapports CTI, playbooks).
  • Alignement et limitation des hallucinations : mettre en œuvre des techniques d'apprentissage par renforcement pour s'assurer que les modèles génèrent des réponses précises, sécurisées et sans biais/hallucinations (crucial pour le SOC).
  • Formatage et structuration des données : définir et appliquer les meilleurs formats de prompt et de conversation pour l'entraînement.
  • Évaluation et benchmarking : mettre en place des pipelines d'évaluation rigoureux pour mesurer la performance des modèles spécialisés "Cyber" par rapport aux standards du marché.

Outils & Environnement

  • Fine-tuning de modèles (PEFT) : maîtrise avancée des techniques d'adaptation à faible rang telles que LoRA et QLoRA.
  • Frameworks de fine-tuning rapide : Unsloth, Axolotl, TRL (Transformer Reinforcement Learning d'Hugging Face).
  • Structuration & formatage de données : utilisation des formats de templates de discussion, notamment ChatML et Alpaca.
  • Alignement & reinforcement learning : optimisation des réponses via DPO (Direct Preference Optimization), GRPO (Group Relative Policy Optimization), PPO (Proximal Policy Optimization).
  • Frameworks d'alignement : TRL, verl, OpenRLHF.
  • Évaluation & validation : conception de protocoles d'évaluation rigoureux, utilisation de benchmarks standards (MMLU, GSM8K), mise en place de frameworks d'évaluation comparatifs internes (Evaluation Arena, LMSYS, LLM-as-a-judge).
  • Stack MLOps (apprécié) : plateformes comme Hugging Face Hub, vLLM, Ollama, Triton.
  • Développement : excellente maîtrise de Python et PyTorch.

Conditions de travail

  • Collaboration directe avec les équipes R&D Cyber et SOC.
  • Environnement R&D agile.
  • Communication avec des profils cybersécurité (Analystes SOC, RSSI).
  • Niveau d'anglais courant requis.

Exigences du poste

Stack technique :

Fine-tuningLoRAQLoRATRLChatMLDPO

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

À propos de l'entreprise

Voir toutes les offres de Salutech

Publié par

Recruteur
Recruteur

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.