Contexte
Le SRE accompagnera les équipes Ops dans la mise en place et la structuration de la démarche SRE. Il jouera un rôle clé d’acculturation, de structuration des pratiques et de fiabilisation des services IT critiques. Vous travaillerez de manière collaborative avec les Ops sur des sujets natif et d’observabilité.
Missions principales
- Mise en place de la démarche SRE
- Définir et formaliser les SLI / SLO / SLA
- Participer à la définition des budgets d’erreur
- Mettre en place les indicateurs de fiabilité et de performance
- Accompagner la transformation des pratiques Ops vers un modèle SRE
- Contribuer à la réduction du toil (automatisation, industrialisation)
- Accompagnement des équipes Ops
- Être en support des équipes d’exploitation
- Challenger les pratiques existantes
- Structurer les rituels de suivi de la fiabilité
- Observabilité & Monitoring
- Implémenter et optimiser la supervision via Dynatrace et Elastic Stack
- Construire des dashboards pertinents pour les Ops et les métiers
- Mettre en place des alertes intelligentes (réduction du bruit)
- Exploiter logs, métriques et traces distribuées
- Mettre en œuvre une approche proactive de détection des incidents
- Collaboration avec les métiers
- Comprendre les enjeux business et la criticité des applications
- Traduire les besoins métiers en objectifs de fiabilité mesurables
Profil recherché
Expertise SRE
- Maîtrise des concepts SRE (SLI, SLO, SLA, Error Budget)
- Amélioration du MTTR
- Réduction du nombre d’incidents majeurs
- Taux de respect des SLO
- Réduction du bruit d’alerting
Outils
- Expertise avancée sur Dynatrace (APM, Synthetic, RUM, alerting)
- Expertise sur Elastic Stack (Elasticsearch, Logstash, Kibana)
Environnement technique
- Linux / Windows Server
- Cloud (AWS / GCP)
- CI/CD
Compétences humaines
- Proactivité et esprit d’initiative
- Capacité à aller chercher l’information auprès des Ops et métiers
- Esprit d’analyse et de synthèse
- Communication claire avec équipes techniques et métiers