Nous recrutons pour le compte d'un de nos clients, une organisation opérant une plateforme digitale à fort enjeu de disponibilité (engagement de service de 99,95%), un(e) Incident Manager / Ingénieur Ops confirmé(e) pour reprendre le lead technique dans le cadre d'une mission longue durée de 3 ans.
Vos missions
Rattaché(e) aux équipes techniques, vous êtes l'interlocuteur(trice) principal(e) de la gestion des incidents et garant(e) de la qualité de service de la plateforme :
- Prendre en charge et piloter la résolution des incidents de production, en identifiant rapidement la cause racine des problèmes
- Instrumenter les systèmes et exploiter les métriques pour anticiper et détecter les anomalies
- Mettre en oeuvre les plans d'action avec les équipes produits afin de garantir l'engagement de disponibilité de la plateforme
- Faire le lien entre les équipes techniques et les équipes métiers/produits, en sachant vulgariser les enjeux techniques
- Contribuer à la fiabilisation et à l'amélioration continue des systèmes en environnement conteneurisé
- Expérience de 3 ans minimum en tant qu'Ingénieur Ops, Incident Manager, SRE ou dans un rôle similaire
- Maîtrise des outils de CI/CD
- Bonne compréhension des principes de sécurité et des bonnes pratiques associées
- Expérience confirmée avec les conteneurs et les orchestrateurs (Docker, Kubernetes)
- Maîtrise des langages de scripting (Python, Shell)
- Bonne connaissance des outils de supervision/observabilité (type Datadog) et de gestion des logs
- Une connaissance d'un environnement cloud (GCP) est un plus
- Sens du service, aisance relationnelle et excellente communication, à l'aise pour échanger avec des interlocuteurs techniques comme non-techniques
- Envie de s'investir sur une mission longue et de reprendre un rôle de lead