Taux journalier (TJM): 550
Contexte
Ce poste s'inscrit dans une démarche d'amélioration continue des pratiques Site Reliability Engineering (SRE) au sein d'une organisation cherchant à industrialiser ses processus, renforcer la pro-activité et optimiser la gestion des incidents et problèmes en production.
Missions
Industrialisation et méthodologie SRE
- Piloter la pro-activité en s'appuyant sur une expérience quotidienne du support
- Identifier les tâches répétitives et les automatiser
- Piloter par la data : animer et suivre les indicateurs de niveau de service
- Augmenter les moyens d'observabilité : faire évoluer les tableaux de bord (Datadog) pour détecter et corriger les anomalies au plus tôt
Résolution d'incidents et soutien applicatif (le "Run")
- Résoudre les incidents de production via l'outil SMAX
- Diagnostiquer, investiguer et résoudre les dysfonctionnements complexes nécessitant une compréhension approfondie des algorithmes et des flux métier
- Communiquer de manière rigoureuse (StatusPal) auprès des parties prenantes
Gestion des problèmes et transversalité
- Identifier les causes racines pour assécher durablement les récurrences
- Coordonner les actions avec l'écosystème, assurer la cohérence avec les équipes partenaires et leurs applications
- Animer et suivre les actions des Post Mortems
Compétences
- SRE : Expert
- Architecture cloud-native : Élémentaire
- Rapports et indicateurs : Confirmé
- SMAX : Confirmé
- JAVA : Élémentaire
- DATADOG : Confirmé