Cette offre n'affiche pas de salaire. D'après 54 offres pour ce poste (Top profil, Île-de-France), le marché se situe autour de 572€/j (525€/j–625€/j).
Nous recherchons pour le compte de notre client un(e) Expert(e) Kubernetes / IA pour assurer l’exploitation, la disponibilité, la performance et la stabilité d’un cluster IA reposant sur des infrastructures GPU/CPU, réseau et stockage.
Le profil recherché devra également contribuer à l’automatisation de l’exploitation, au traitement des incidents et à l’amélioration continue de l’infrastructure.
Missions principalesMaintien en condition opérationnelle – MCO
Garantir la disponibilité, la performance et la stabilité du cluster IA.
Administrer les nœuds GPU/CPU, les infrastructures de stockage et les composants réseau.
Assurer le suivi et l’optimisation des ressources de l’infrastructure.
Piloter les opérations de maintenance et les mises à jour techniques.
Administration Linux
Installer, configurer et administrer les environnements Linux Ubuntu.
Réaliser les opérations d’optimisation et de troubleshooting.
Administrer et mettre à jour les pilotes NVIDIA, CUDA et composants associés.
Kubernetes
Administrer et exploiter les environnements Kubernetes.
Réaliser les déploiements, le scaling et la gestion de la haute disponibilité (HA).
Assurer le maintien en conditions opérationnelles des clusters.
Piloter les mises à jour des composants Kubernetes.
Gérer les problématiques liées aux ressources et à la capacité des clusters.
Supervision et observabilité
Mettre en place et maintenir la supervision des infrastructures.
Exploiter Prometheus et Grafana pour le monitoring et l’analyse des performances.
Identifier les anomalies et anticiper les incidents grâce à une approche proactive.
Automatisation
Automatiser les tâches d’administration et d’exploitation avec Ansible.
Développer et maintenir des scripts Bash et Python.
Optimiser les processus opérationnels afin de réduire les tâches manuelles.
Gestion des jobs IA / GPU
Assurer l’ordonnancement des tâches et jobs GPU.
Gérer les quotas, priorités et ressources GPU.
Optimiser l’allocation des ressources CPU/GPU.
Gestion des incidents
Prendre en charge les incidents techniques complexes.
Réaliser les analyses de causes racines et les post-mortems.
Définir et suivre les plans d’actions correctifs.
Coordonner les interventions avec les différentes équipes techniques.
Documentation
Rédiger et maintenir la documentation d’exploitation.
Formaliser les procédures techniques et les consignes de maintenance.
Garantir la traçabilité et la continuité des opérations.
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.