OmDev Logo
GetYourJob
0
Publié il y a 86 jours

Site Reliability Engineer - SRE - Freelance

Entreprise
Top ProfilCabinet de recrutement
Localisation
France
Full remote
Type de contrat
Freelance
Niveau

Salaire du marché

Médiane du marché
500€/j
Estimation
425€/jfourchette habituelle572€/j

Cette offre n'affiche pas de salaire. D'après 270 offres pour ce poste (tous niveaux, France), le marché se situe autour de 500€/j (425€/j–572€/j).

0vues
0clics

Description du poste

Contexte

Nous accompagnons une scale-up SaaS B2B en forte croissance, dont la plateforme gère des flux métier critiques liés au procurement et à la réservation.

L’entreprise dispose déjà d’une équipe DevOps impliquée, notamment sur les sujets proches des développeurs, l’automatisation de la CI et les pratiques de delivery. Elle souhaite désormais accélérer fortement sur la dimension Site Reliability Engineering : fiabilité applicative, observabilité, résilience, maîtrise du continuous delivery et capacité à opérer une plateforme SaaS à grande échelle.

Le besoin ne correspond pas à un rôle d’infrastructure classique ni à un profil centré uniquement sur le provisioning cloud ou l’IaC. L’entreprise recherche un expert SRE capable d’intervenir à la frontière entre le cloud, la plateforme et les applications, avec une expérience éprouvée de systèmes SaaS B2B à fort enjeu de disponibilité.

Objectif de la mission

Établir et exécuter une trajectoire claire pour faire progresser la fiabilité, l’observabilité et la maturité de delivery de la plateforme.

Le consultant devra rapidement analyser l’existant, définir les priorités, proposer un plan réaliste de transformation et le dérouler avec les équipes Engineering, DevOps et Infrastructure.

L’objectif est d’éviter une approche théorique ou une mission de conseil sans exécution : le profil devra être capable d’identifier ce qui doit être corrigé, de prioriser les chantiers, d’embarquer les équipes et de produire des améliorations concrètes sur une période d’environ six mois.

Responsabilités principales

Fiabilité et résilience applicative

  • Évaluer le niveau de maturité actuel de la plateforme en matière de fiabilité, résilience, disponibilité et gestion des défaillances.

  • Identifier les principaux risques opérationnels, techniques et organisationnels pouvant affecter l’expérience client ou la capacité de delivery.

  • Définir une trajectoire d’amélioration pragmatique, adaptée au niveau de croissance et aux priorités business de l’entreprise.

  • Faire progresser les pratiques de conception, de déploiement et d’exploitation des services afin de réduire les incidents, les régressions et les indisponibilités.

  • Aider les équipes à intégrer les sujets de résilience dès la conception des fonctionnalités, plutôt que de les traiter uniquement après incident.

Observabilité et monitoring

  • Auditer et faire évoluer les pratiques d’observabilité de la plateforme.

  • Structurer l’usage de Datadog pour améliorer la visibilité sur la santé des services, les performances applicatives, les anomalies et les incidents.

  • Définir des indicateurs techniques et opérationnels réellement utiles aux équipes Engineering et aux décideurs.

  • Améliorer la qualité des alertes, du monitoring et de l’investigation afin de réduire le bruit et d’accélérer la détection des incidents significatifs.

  • Mettre en place les fondations permettant de piloter la fiabilité de manière factuelle et continue.

Continuous Delivery et qualité du delivery

  • Évaluer les pratiques CI/CD existantes et identifier les freins à un delivery rapide, fiable et maîtrisé.

  • Faire évoluer les pipelines GitHub Actions afin de renforcer la qualité, la reproductibilité et la sécurité des mises en production.

  • Améliorer la capacité des équipes à livrer fréquemment tout en limitant le risque de régression.

  • Identifier les pratiques de delivery qui doivent être renforcées : contrôles de qualité, automatisation, gestion des déploiements, capacité de rollback, réduction des risques de mise en production.

  • Travailler avec les équipes applicatives pour faire du continuous delivery un levier de vitesse et non une source de fragilité.

Interface entre Infrastructure, DevOps et équipes applicatives

  • Travailler à la frontière entre AWS, les pratiques d’infrastructure et les applications NestJS / Next.js.

  • Collaborer étroitement avec les équipes DevOps, Engineering et Infrastructure afin de faire évoluer les pratiques de manière cohérente.

  • Éviter une approche en silos entre plateforme, cloud et développeurs.

  • Transmettre des méthodes, standards et réflexes SRE à l’équipe interne afin de faire monter durablement les collaborateurs en compétence.

  • Accompagner le ramp-up de profils internes intéressés par les sujets SRE, sans faire reposer la réussite de la mission sur leur apprentissage initial.

IA et efficacité opérationnelle

  • Identifier les usages pertinents de l’IA pour accélérer les pratiques SRE et Engineering.

  • Challenger l’utilisation de l’IA dans l’analyse d’incidents, l’investigation, le monitoring, l’automatisation, la documentation et l’amélioration du tooling.

  • Veiller à ce que ces usages apportent un bénéfice concret en matière de vitesse de résolution, qualité de décision ou fiabilité, sans créer de dépendances ou de risques non maîtrisés.

Environnement technique

  • Applications : NestJS, Next.js

  • API : GraphQL

  • Cloud : AWS

  • CI/CD : GitHub Actions

  • Observabilité : Datadog

Profil recherché

  • Très forte expérience en Site Reliability Engineering dans un environnement SaaS B2B à fort enjeu de disponibilité et de scalabilité.

  • Expérience réelle et démontrable de la fiabilité applicative à grande échelle, idéalement acquise sur plusieurs années.

  • Capacité à intervenir au croisement du cloud, de la plateforme et des applications ; le rôle ne convient pas à un profil uniquement orienté infrastructure ou provisioning.

  • Solide maîtrise de l’observabilité, du monitoring, de la gestion des incidents, de la résilience et du continuous delivery.

  • Expérience approfondie d’AWS, GitHub Actions et Datadog.

  • Compréhension forte des contraintes applicatives et du delivery logiciel ; une expérience Node.js, NestJS ou d’écosystèmes backend proches constitue un avantage.

  • Capacité à réaliser rapidement un diagnostic, à proposer un plan crédible et à le mettre en œuvre avec les équipes.

  • Autonomie élevée, forte exigence technique et capacité à prioriser dans un contexte de croissance rapide.

  • Sensibilité aux usages concrets de l’IA pour améliorer les pratiques d’ingénierie et d’exploitation.

Processus de recrutement

  • Entretien technique initial avec le VP Engineering et un interlocuteur DevOps / plateforme.

  • Entretien complémentaire avec les responsables Engineering et Infrastructure.

  • Process volontairement court, centré sur la capacité du candidat à démontrer des expériences concrètes de SRE, d’observabilité, de résilience et de continuous delivery à l’échelle.

Exigences du poste

Stack technique :

SREDevOpsAWSDatadogGitHub

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

À propos de l'entreprise

Top ProfilCabinet de recrutement
Voir toutes les offres de Top Profil

Publié par

Recruteur
Recruteur

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.