Pour le compte d'un client dans le secteur de l'assurance : Environnement IT critique, hybride, applicatif et infrastructure, avec enjeux forts de disponibilité, stabilité et réduction des incidents.
Intervenir au sein d’une équipe SRE transverse dédiée à l’amélioration de la fiabilité des services critiques.
Analyser les incidents récurrents, identifier les causes racines, proposer des plans de remédiation et mettre en œuvre des améliorations durables sur les applications, workflows et mécanismes d’exploitation.
Travailler en profondeur sur des problématiques de production complexes, en lien avec les équipes applicatives, infrastructure et métiers.
Analyser les incidents de disponibilité, les problèmes récurrents et les signaux faibles de production.
Conduire ou contribuer aux RCA, post-mortems et analyses blameless.
Identifier les causes racines techniques et organisationnelles.
Définir un plan d’action priorisé : quick wins, corrections structurelles, dette technique.
Améliorer la résilience applicative : timeouts, retries, circuit breakers, dégradation contrôlée.
Optimiser les performances applicatives et réduire le MTTR.
Mettre en place ou améliorer les indicateurs de stabilité : disponibilité, erreurs, latence, saturation.
Réduire le bruit d’alerting et renforcer l’observabilité.
Automatiser les analyses, contrôles ou actions récurrentes lorsque pertinent.
Documenter les patterns de fiabilité et contribuer à la montée en compétence des équipes internes.
Analyse d’incidents complexes et démarches RCA.
Observabilité : Dynatrace, Datadog, ELK, Prometheus, Grafana ou équivalents.
Environnements applicatifs : Java, Python, AngularJS, Cobol ou SaaS.
CI/CD : Jenkins, GitLab CI/CD ou équivalents.
Automatisation : Python, Bash ou scripting équivalent.
Environnements cloud ou hybrides, notamment AWS.
Golden signals : latence, trafic, erreurs, saturation.
Outils d’IA pour productivité : analyse de logs, corrélation d’incidents, génération de scripts, détection de code smells.
Type de mission : Freelance
Présence : Hybride, 2 à 3 jours sur site par semaine
Analyses de causes racines et rapports de post-mortem.
Backlog de remédiation priorisé.
Actions correctives mises en œuvre.
Tableaux de bord et indicateurs de fiabilité.
Documentation des bonnes pratiques et patterns SRE.
Contributions aux comités de suivi de la stabilité.
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.