OmDev Logo
GetYourJob
0
Publié il y a 17 jours

Expert DevOps (H/F)

Entreprise
Cherry PickPlateforme freelance
Localisation
Paris
Hybride
Type de contrat
Freelance
Niveau
Mid
Rémunération
450ۥ Taux journalier

Salaire du marché

Médiane du marché
500€/j
Dans le marché
450€/jfourchette habituelle525€/j
Cette offre : 450€/j

Basé sur 10 offres pour ce poste (Mid, Paris, 3 dernières semaines). Fourchette habituelle 450€/j–525€/j, médiane 500€/j. Cette offre (450€/j) est dans la fourchette.

0vues
0clics

Description du poste

🎯 Contexte de mission

Dans le cadre de la mise en place d’un nouveau cluster d’infrastructure dédié aux projets Data et Intelligence Artificielle, une équipe spécialisée est constituée afin d’assurer l’administration et l’exploitation de cette plateforme.

La mission porte principalement sur le déploiement, l’administration, l’optimisation et le maintien en condition opérationnelle (MCO) d’une infrastructure reposant sur des environnements Linux, Kubernetes et GPU NVIDIA.

L’Expert DevOps évoluera au sein d’une équipe technique restreinte et travaillera en étroite collaboration avec les experts MLOps et cybersécurité afin de garantir la performance, la disponibilité et la sécurité de l’infrastructure.

🛠️ Missions principales et rôle

🖥️ Administration & exploitation

  • Administrer et maintenir le cluster Linux dédié aux workloads Data, IA et Machine Learning.

  • Assurer le maintien en condition opérationnelle de l’infrastructure.

  • Diagnostiquer et résoudre les incidents liés aux composants système et infrastructure.

  • Participer au déploiement et à l’évolution de la plateforme.

  • Optimiser les performances et l’utilisation des ressources matérielles.

☸️ Orchestration & conteneurisation

  • Administrer et exploiter les environnements Kubernetes.

  • Gérer la conteneurisation avec Docker.

  • Organiser le découpage et l’allocation des ressources matérielles.

  • Optimiser l’utilisation des ressources CPU/GPU au sein du cluster.

  • Accompagner le déploiement des workloads IA sur l’infrastructure.

🤖 Infrastructure GPU

  • Administrer les infrastructures équipées de GPU NVIDIA.

  • Intervenir sur les environnements CUDA.

  • Gérer les mécanismes de partitionnement et d’allocation GPU, notamment Multi-Instance GPU (MIG).

  • Contribuer à l’optimisation des ressources GPU pour les workloads IA/ML.

  • Collaborer avec les équipes MLOps afin d’adapter l’infrastructure aux besoins des modèles et applications IA.

🔄 Automatisation & Infrastructure as Code

  • Automatiser la gestion des configurations et des infrastructures.

  • Développer et maintenir les playbooks et automatisations Ansible.

  • Automatiser le provisionnement et les déploiements.

  • Améliorer la reproductibilité et la fiabilité des opérations d’administration.

  • Contribuer à l’industrialisation des processus d’exploitation.

📊 Supervision & observabilité

  • Mettre en place et maintenir la supervision de l’infrastructure.

  • Développer et exploiter les dispositifs de monitoring avec Prometheus et Grafana.

  • Suivre les indicateurs de disponibilité, performance et capacité.

  • Participer à l’analyse des logs et au diagnostic des incidents.

  • Améliorer la visibilité sur l’état et les performances du cluster.

💾 Stockage haute performance

  • Administrer les architectures de stockage distribué haute performance.

  • Optimiser les performances et la capacité des systèmes de stockage.

  • Garantir leur adéquation avec les besoins des workloads Data/IA.

  • Participer à la résolution des problématiques liées aux volumes de données importants.

🔐 Sécurité & gestion des accès

  • Collaborer avec les équipes cybersécurité sur la sécurisation de l’infrastructure.

  • Appliquer les règles de durcissement système et réseau.

  • Participer à la sécurisation des environnements Linux, Kubernetes et GPU.

  • Contribuer à la gestion et au contrôle des accès à la plateforme.

🎯 Objectifs

  • Garantir la disponibilité, performance et stabilité du cluster IA.

  • Assurer le maintien en condition opérationnelle de l’infrastructure.

  • Optimiser l’utilisation des ressources GPU, CPU et stockage.

  • Industrialiser et automatiser les opérations d’administration.

  • Mettre en place une supervision et une observabilité efficaces.

  • Fournir une infrastructure fiable et adaptée aux besoins des équipes Data Scientists et MLOps.

  • Garantir le respect des exigences de sécurité et de durcissement.

📦 Livrables

  • Infrastructure Kubernetes/Linux opérationnelle et maintenue.

  • Playbooks et automatisations Ansible.

  • Dispositifs de supervision et dashboards Prometheus / Grafana.

  • Documentation technique de l’infrastructure.

  • Procédures d’exploitation et de maintenance.

  • Documentation relative à l’allocation et à l’utilisation des ressources GPU.

  • Contributions aux procédures de sécurité et de durcissement.

💻 Compétences requises

🐧 Systèmes & infrastructure

  • Linux / Ubuntu.

  • Administration de systèmes Linux en environnement complexe.

  • Exploitation et maintien en condition opérationnelle d’infrastructures techniques.

☸️ Conteneurisation & orchestration

  • Kubernetes.

  • Docker.

  • Gestion des ressources et workloads conteneurisés.

  • Administration de clusters Kubernetes.

🤖 GPU & HPC

  • GPU NVIDIA.

  • CUDA.

  • Multi-Instance GPU (MIG).

  • Environnements de calcul haute performance (HPC).

  • Optimisation des ressources GPU.

🔄 Automatisation

  • Ansible.

  • Automatisation du provisionnement et de la configuration.

  • Industrialisation des opérations d’exploitation.

📊 Supervision & logs

  • Prometheus.

  • Grafana.

  • Monitoring et observabilité d’infrastructures.

  • Analyse des logs et diagnostic d’incidents.

💾 Stockage

  • Architectures de stockage distribué haute performance.

  • Gestion de volumes de données importants.

  • Optimisation des performances de stockage.

🔐 Sécurité

  • Durcissement des systèmes Linux.

  • Sécurité réseau et système.

  • Gestion des accès aux infrastructures.

  • Collaboration avec des équipes cybersécurité.

👤 Profil

  • Formation supérieure en informatique, systèmes, réseaux ou ingénierie.

  • Expérience de 3 à 5 ans minimum en tant qu’Ingénieur ou Consultant DevOps.

  • Expérience sur des infrastructures complexes, idéalement dans des environnements HPC, GPU ou Data/IA.

  • Solides compétences en Linux, Kubernetes, Docker et Ansible.

  • Bonne compréhension des architectures GPU NVIDIA et de CUDA.

  • Expérience en supervision et observabilité d’infrastructures.

  • Capacité à intervenir sur des environnements de stockage haute performance.

  • Sensibilité forte aux enjeux de sécurité et de MCO.

  • Autonomie, rigueur et capacité à diagnostiquer des problématiques complexes.

  • Bon relationnel et capacité à travailler en équipe restreinte.

  • Aptitude à collaborer efficacement avec les équipes MLOps et cybersécurité.

Exigences du poste

Stack technique :

Linux ubuntuAdministration système LinuxKubernetesDockerManagement d'équipeWorkloadNvidia gpuHPCAnsiblePrometheusGrafanaMonitoring / ObservabilityAnalyse des logsOptimisation des performancesSystèmes LinuxFirewallSecurité systèmeRBAC

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

À propos de l'entreprise

Cherry PickPlateforme freelance
Secteur ::Autre
Voir toutes les offres de Cherry Pick

Publié par

Recruteur
Recruteur

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.