Votre rôle au sein d'Exaion :
Rattaché au service Infrastructure, votre mission est d’assurer la haute disponibilité, la sécurité et la performance des clusters de production supportant nos applications critiques.
Vous intervenez en tant qu'ingénieur autonome sur les sujets de tuning, de débogage complexe et d’amélioration des processus, en collaboration avec les équipes techniques.
Vos missions sont les suivantes :
- Administration Avancée & Maintenance des Clusters
- Exploitation Haute Disponibilité : Vous administrez nos clusters Kubernetes (On-Premise et/ou Cloud) en assurant leur résilience et leur continuité de service.
- Mises à Jour & Évolutions : Vous planifiez et réalisez les opérations de mise à jour du plan de contrôle (control plane) et des nœuds, en validant la compatibilité et en minimisant les impacts business.
- Gestion du Cycle de Vie : Vous supervisez le provisioning des ressources, la gestion des certificats TLS et la sauvegarde/restauration des états critiques (ETCD).
- Optimisation des Performances & Fiabilité
- Tuning Ressources : Vous analysez les consommations CPU/Memory et ajustez les quotas/limits des pods pour optimiser la densité et réduire les coûts infrastructurels.
- Résolution d’Incidents Complexes : Vous prenez en charge les incidents de niveau 2/3 liés à l’orchestration (network policies issues, storage binding delays, crash loops, scheduler blocking) et identifiez les causes racines profondes.
- Amélioration Continue : Vous proposez et mettez en œuvre des correctifs pour améliorer les temps de démarrage, la stabilité des connexions réseau et la fiabilité des disques persistants.
- Sécurité & Gouvernance Opérationnelle
- Hardening des Clusters : Vous appliquez et faites respecter les benchmarks de sécurité CIS pour Kubernetes (durcissement du API Server, des nodes, des runtime containers).
- Sécurisation du Cluster : Vous implémentez les contrôles d’accès (RBAC) et le micro-segmentation réseau (Network Policies) pour isoler les environnements et limiter les risques.
- Conformité : Vous assurez que les configurations clusters respectent les normes internes (ISO 27001, NIS2) et participez aux audits techniques.
- Support Expert & Accompagnement Interne
- Support Techniques Haut Niveau : Vous assistez les différentes équipes dans le débogage d’applications nécessitant une compréhension fine du cycle de vie Pod/Service/Ingress.
- Expertise Déploiement : Vous apportez votre expertise pour valider les patterns de déploiement proposés par les développeurs (orchestration, services réseau) et vous assurez de leur robustesse avant leur industrialisation.
- Transmission du Savoir : Vous capitalisez vos expériences sous forme de runbooks et documentez les procédures de résolution d’incidents pour rendre les équipes plus autonomes.
- Automatisation & Observabilité
- Automatisation Ops : Vous scriptez les tâches récurrentes d’administration K8s (Python/Bash) pour réduire l’intervention manuelle.
- Monitoring Proactif : Vous configurez et affinez les alertes Prometheus/Grafana spécifiques à Kubernetes pour détecter les dégradations avant qu’elles ne deviennent des incidents.