Votre objectif : contribuer directement à la fiabilité, la disponibilité, la performance et la sécurité des services en production, tout en participant activement à l’évolution de l’infrastructure et des pratiques SRE.
Vous interviendrez avec un niveau d’autonomie important sur l’ensemble du cycle de vie de l’infrastructure, de son automatisation jusqu’à son exploitation en production.
Principales missions et responsabilités
- Concevoir, maintenir et faire évoluer l’infrastructure AWS en production
- Automatiser et industrialiser l’infrastructure avec Terraform
- Maintenir et améliorer les pipelines CI/CD
- Administrer et optimiser des environnements conteneurisés avec Kubernetes et/ou ECS
- Faire évoluer l’observabilité des services : métriques, logs, traces, dashboards et alerting
- Participer à la définition et au suivi des SLI / SLO
- Traduire les enjeux de disponibilité en solutions concrètes de monitoring, redondance et déploiement
- Participer à la gestion des incidents de production, à l’analyse des causes racines et aux post-mortems
- Renforcer la sécurité de l’infrastructure et les bonnes pratiques autour des accès et des secrets
- Automatiser les tâches opérationnelles répétitives afin de réduire les interventions manuelles
- Accompagner les équipes de développement sur les problématiques d’infrastructure, de déploiement et de production
- Identifier et porter des améliorations en matière de fiabilité, performance, sécurité et coûts Cloud
- Faire évoluer les runbooks, la documentation et les bonnes pratiques SRE