Basé sur 11 offres pour ce poste (Senior, Paris, 3 dernières semaines). Fourchette habituelle 500€/j–625€/j, médiane 500€/j. Cette offre (350€/j) est sous la fourchette.
Dans le cadre du renforcement du pôle Observabilité et Fiabilité, nous recherchons un Site Reliability Engineer (SRE) pour garantir la disponibilité, la performance, la résilience et l’observabilité du Système d’Information.
Vous évoluerez dans un environnement de production critique et participerez au maintien en conditions opérationnelles des plateformes, à la gestion des incidents, à l'amélioration continue des services et à l'automatisation des activités d'exploitation. Vous intégrerez également un dispositif d'astreinte selon un roulement défini.
Rattaché(e) à l'équipe Observabilité et Fiabilité, vous serez en charge de :
Assurer le maintien en conditions opérationnelles des services, infrastructures et plateformes.
Superviser les environnements de production et analyser les alertes, événements et incidents.
Diagnostiquer et coordonner la résolution des incidents avec les équipes techniques.
Anticiper les incidents grâce à l'analyse des tendances, des capacités et des risques.
Réaliser les analyses post-incidents (RCA) et piloter les actions de fiabilisation.
Concevoir, maintenir et améliorer les tableaux de bord, métriques et règles d'alerting.
Optimiser les mécanismes de supervision afin de réduire les alertes inutiles et le bruit opérationnel.
Participer aux cellules de crise et aux démarches d'amélioration continue.
Automatiser et industrialiser les activités d'exploitation selon les pratiques DevOps.
Maintenir à jour la documentation technique, les procédures et les référentiels d'exploitation.
Garantir un haut niveau de disponibilité et de fiabilité des plateformes de production.
Améliorer en continu l'observabilité des systèmes et la qualité de service.
Réduire le nombre d'incidents récurrents grâce à l'automatisation et aux actions correctives.
Optimiser les mécanismes de supervision et les processus d'exploitation.
Contribuer à la résilience et à la performance globale du Système d'Information.
Kubernetes
Docker
Linux & Windows
VMware
Architectures distribuées
Cloud / Hybride
Prometheus
Grafana
Splunk
Tempo
Centreon
Monitoring, métriques, logs, traces et alerting
Python
Shell Linux
Automatisation des tâches d'exploitation
Pratiques DevOps
Spring Boot
JBoss
PostgreSQL
MariaDB
Site Reliability Engineering (SRE)
ITIL (gestion des événements, incidents et problèmes)
Agile
DevOps
Gestion des incidents majeurs et cellules de crise
Formation Bac+5 en informatique ou équivalent.
Expérience significative en tant que Site Reliability Engineer, Production Engineer ou Ingénieur Exploitation.
Solide expérience des environnements de production critiques et fortement distribués.
Maîtrise des outils d'observabilité et de supervision.
Bonne connaissance des architectures conteneurisées Kubernetes.
Expérience de l'automatisation et de l'amélioration continue des processus d'exploitation.
Capacité à diagnostiquer des incidents complexes et à coordonner plusieurs équipes techniques.
Excellentes qualités de communication, d'analyse et de rédaction.
Autonomie, rigueur, esprit d'équipe et sens du service.
Force de proposition dans l'amélioration de la fiabilité et de la résilience des plateformes.
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.