Basé sur 14 offres pour ce poste (Senior, Paris, 3 dernières semaines). Fourchette habituelle 450€/j–620€/j, médiane 525€/j. Cette offre (650€/j) est au-dessus de la fourchette.
Dans le cadre du développement d'une plateforme DeepTech exploitant l'intelligence artificielle, des modèles génératifs et des infrastructures de calcul avancées, nous recherchons un Site Reliability Engineer (SRE) Senior.
Intégré à l'équipe Infrastructure, le consultant sera garant de la fiabilité, de la disponibilité, de la performance et de la scalabilité des plateformes critiques. Il contribuera à la définition des pratiques SRE, à l'automatisation des infrastructures, à l'amélioration de l'observabilité ainsi qu'à l'accompagnement des équipes de développement afin de promouvoir une culture de la fiabilité et de l'excellence opérationnelle.
Concevoir, déployer et maintenir des infrastructures hautement disponibles, performantes et évolutives.
Définir et faire évoluer les indicateurs de fiabilité (SLO, SLA, SLI) ainsi que les dispositifs de supervision et d'alerting.
Mettre en œuvre les processus de gestion des incidents et piloter les analyses de causes racines (RCA).
Collaborer avec les équipes Produit, Développement, Data et IA afin de concevoir des services résilients et observables.
Identifier les limitations des infrastructures et proposer des optimisations en matière de performance, capacité et disponibilité.
Automatiser le provisioning, les déploiements et l'administration des infrastructures via des approches Infrastructure as Code.
Participer à l'optimisation des coûts Cloud et à la planification de capacité.
Contribuer à la mise en place des bonnes pratiques SRE et DevOps au sein des équipes techniques.
Accompagner et mentorer les ingénieurs afin de diffuser les pratiques de fiabilité et d'observabilité.
Participer aux décisions d'architecture et aux initiatives techniques transverses.
Garantir une haute disponibilité et une forte résilience des plateformes de production.
Améliorer les performances, la scalabilité et la stabilité des infrastructures.
Renforcer les capacités d'observabilité, de monitoring et d'alerting.
Réduire les incidents de production et améliorer les délais de détection et de résolution.
Industrialiser l'automatisation des infrastructures et des déploiements.
Développer une culture de la fiabilité partagée entre les équipes d'ingénierie.
Site Reliability Engineering (SRE)
Cloud AWS
Administration Linux
Réseaux
Kubernetes
Infrastructure as Code (IaC)
Observabilité et monitoring
Gestion des incidents de production
Capacity Planning
Analyse de causes racines (RCA)
Automatisation des infrastructures
AWS
Kubernetes
Terraform
Ansible
Prometheus
Grafana
Datadog
Python
Bash
Go
FastAPI
Apache Airflow
Snowflake
SRE
DevOps
Infrastructure as Code
Incident Management
Post-mortem / RCA
Amélioration continue
Expérience confirmée (6 ans minimum) en tant que Site Reliability Engineer, DevOps ou Ingénieur Infrastructure.
Solide expertise des environnements Cloud, idéalement AWS.
Excellente maîtrise des systèmes Linux, des architectures distribuées et des réseaux.
Expérience confirmée avec Kubernetes et les technologies de conteneurisation.
Maîtrise des outils d'observabilité et de monitoring (Prometheus, Grafana, Datadog...).
Bonne connaissance des outils d'Infrastructure as Code tels que Terraform et Ansible.
Solides compétences en développement et scripting (Python, Bash, Go ou équivalent).
Capacité à concevoir et piloter des initiatives techniques transverses de manière autonome.
Excellentes qualités d'analyse, de résolution de problèmes et de gestion des situations critiques.
Aptitude à accompagner, former et faire monter en compétence les équipes techniques.
Anglais professionnel permettant d'évoluer dans un environnement international.
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.