OmDev Logo
GetYourJob
0
Publié il y a 46 jours

Expert kubernetes /ia (h/f) : kubernetes, prometheus

Entreprise
Localisation
Fontenay-aux-Roses, Île-de-France
Hybride
Type de contrat
Freelance
Niveau
Top profil

Salaire du marché

Médiane du marché
572€/j
Estimation
525€/jfourchette habituelle625€/j

Cette offre n'affiche pas de salaire. D'après 54 offres pour ce poste (Top profil, Île-de-France), le marché se situe autour de 572€/j (525€/j–625€/j).

0vues
0clics

Description du poste

EXPERT KUBERNETES / IA (H/F)Contexte de la mission

Nous recherchons pour le compte de notre client un(e) Expert(e) Kubernetes / IA pour assurer l’exploitation, la disponibilité, la performance et la stabilité d’un cluster IA reposant sur des infrastructures GPU/CPU, réseau et stockage.

Le profil recherché devra également contribuer à l’automatisation de l’exploitation, au traitement des incidents et à l’amélioration continue de l’infrastructure.

Missions principales

Maintien en condition opérationnelle – MCO

  • Garantir la disponibilité, la performance et la stabilité du cluster IA.

  • Administrer les nœuds GPU/CPU, les infrastructures de stockage et les composants réseau.

  • Assurer le suivi et l’optimisation des ressources de l’infrastructure.

  • Piloter les opérations de maintenance et les mises à jour techniques.

Administration Linux

  • Installer, configurer et administrer les environnements Linux Ubuntu.

  • Réaliser les opérations d’optimisation et de troubleshooting.

  • Administrer et mettre à jour les pilotes NVIDIA, CUDA et composants associés.

Kubernetes

  • Administrer et exploiter les environnements Kubernetes.

  • Réaliser les déploiements, le scaling et la gestion de la haute disponibilité (HA).

  • Assurer le maintien en conditions opérationnelles des clusters.

  • Piloter les mises à jour des composants Kubernetes.

  • Gérer les problématiques liées aux ressources et à la capacité des clusters.

Supervision et observabilité

  • Mettre en place et maintenir la supervision des infrastructures.

  • Exploiter Prometheus et Grafana pour le monitoring et l’analyse des performances.

  • Identifier les anomalies et anticiper les incidents grâce à une approche proactive.

Automatisation

  • Automatiser les tâches d’administration et d’exploitation avec Ansible.

  • Développer et maintenir des scripts Bash et Python.

  • Optimiser les processus opérationnels afin de réduire les tâches manuelles.

Gestion des jobs IA / GPU

  • Assurer l’ordonnancement des tâches et jobs GPU.

  • Gérer les quotas, priorités et ressources GPU.

  • Optimiser l’allocation des ressources CPU/GPU.

Gestion des incidents

  • Prendre en charge les incidents techniques complexes.

  • Réaliser les analyses de causes racines et les post-mortems.

  • Définir et suivre les plans d’actions correctifs.

  • Coordonner les interventions avec les différentes équipes techniques.

Documentation

  • Rédiger et maintenir la documentation d’exploitation.

  • Formaliser les procédures techniques et les consignes de maintenance.

  • Garantir la traçabilité et la continuité des opérations.

Exigences du poste

Stack technique :

AnsibleDockerGPUKubernetesLinux AdministrationLinux UbuntuNVIDIA Isaac Sim

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

Publié par

Recruteur
Recruteur

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.