Basé sur 38 offres pour ce poste (tous niveaux, Paris, 3 dernières semaines). Fourchette habituelle 499€/j–625€/j, médiane 530€/j. Cette offre (640€/j) est au-dessus de la fourchette.
Vos missions
Concevoir, mettre en œuvre et maintenir des systèmes garantissant la disponibilité, la performance et la scalabilité de la plateforme
Définir et améliorer les SLO, SLA, le monitoring, l'alerting et les processus de gestion des incidents
Collaborer avec les parties prenantes produit et les équipes d'ingénierie pour construire des systèmes résilients et observables
Identifier et supprimer les goulots d'étranglement d'infrastructure à travers les services et environnements
Diriger les analyses de cause racine et piloter les post-mortems d'incidents et les améliorations de processus
Encadrer d'autres ingénieurs et promouvoir les bonnes pratiques SRE à l'échelle de l'entreprise
Contribuer à l'automatisation de l'infrastructure, à l'optimisation des coûts et à la planification de la capacité
Stack technique
AWS ; Kubernetes (EKS, Karpenter, ArgoCD) ; Terraform ; GitHub Actions (CI/CD) ; observabilité (Prometheus, Grafana, VictoriaMetrics, VictoriaLogs). Enjeu n°1 de la mission : le scaling GPU — comment scaler du GPU et lancer des trainings ML à large échelle. Bonus apprécié : data/MLOps, Airflow. Contexte : forte utilisation de Claude Code en interne, pas encore d'agents déployés mais intérêt marqué — une culture LLM/agentic est un vrai plus.
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.