Basé sur 274 offres pour ce poste (tous niveaux, France, 3 dernières semaines). Fourchette habituelle 415€/j–565€/j, médiane 500€/j. Cette offre (415€/j) est dans la fourchette.
Dans le cadre du renforcement d'une équipe dédiée à l'Observabilité et à la Fiabilité du Système d'Information, nous recherchons un Ingénieur de Production expérimenté spécialisé en Site Reliability Engineering (SRE).
Vous intégrerez une équipe en charge de garantir la disponibilité, la performance, la résilience et l'observabilité d'un SI critique à grande échelle, composé de plusieurs milliers de serveurs, d'environnements conteneurisés et d'applications distribuées.
La mission s'inscrit dans une démarche d'amélioration continue visant à renforcer la qualité de service, automatiser les opérations de production et optimiser la supervision des plateformes.
Au sein de l'équipe Observabilité & Fiabilité, vous serez notamment en charge de :
Assurer le maintien en conditions opérationnelles des infrastructures, plateformes et services.
Garantir le respect des objectifs de disponibilité et de qualité de service.
Surveiller les environnements de production et assurer le diagnostic ainsi que la résolution des incidents.
Participer aux dispositifs d'astreinte (1 semaine sur 5 comprenant soirées, week-ends et jours fériés).
Analyser les événements de production, coordonner les interventions avec les différentes équipes techniques et assurer le suivi des incidents.
Anticiper les incidents grâce à l'analyse des tendances, des capacités et des signaux faibles.
Réaliser les analyses post-incidents (RCA) et piloter les actions de fiabilisation.
Concevoir, maintenir et faire évoluer les tableaux de bord, indicateurs et solutions d'observabilité.
Optimiser les mécanismes d'alerting afin de réduire le bruit opérationnel.
Participer aux cellules de crise et aux processus de gestion des incidents majeurs.
Contribuer à l'automatisation, à l'industrialisation et à la simplification des activités de production.
Rédiger et maintenir la documentation technique ainsi que les procédures d'exploitation.
Être force de proposition dans l'amélioration continue des pratiques de production.
Prometheus
Grafana
Centreon
Splunk
Tempo
Kubernetes
Docker
Linux
Windows
PostgreSQL
MariaDB
JBoss
Spring Boot
Python
Shell Linux
Architectures distribuées
Microservices
Cloud / Hybrid Cloud
VMware
Site Reliability Engineering (SRE)
ITIL
DevOps
Agile
Le périmètre couvre notamment :
Environ 8 000 serveurs
Deux datacenters et un site de secours
Environ 160 applications Java
Environnements virtualisés VMware
Déploiements Kubernetes
Supervision 24/7
Astreinte :
1 semaine sur 5
En semaine : 18h30 à 00h30
Week-end : 08h00 à 19h00
Localisation : Saint-Jean-de-Braye (45)
Durée : 24 mois fermes renouvelables 12 mois
Charge estimée : environ 630 jours
Démarrage prévisionnel : Septembre 2026
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.