Data Platform Engineer H/F
Entreprise: Vusion
Type de contrat: CDI
Localisation: Paris 2ᵉ (75)
Salaire estimé: 45 000 – 67 500 €/an
Niveau d’études: Bac +5
À propos de Vusion
"Nous construisons. Nous créons un impact positif."En tant que
Data Platform Engineer / DataOps, vous contribuerez à concevoir et optimiser des pipelines de production robustes, tout en renforçant l’écosystème data avec des normes de gouvernance, d’observabilité et de qualité. Votre mission : permettre aux équipes produit de livrer des données fiables et exploitables plus rapidement.
Vos missions clés
1. Migration des architectures multi-technologies (Databricks + Unity Catalog + dbt)
- Audit et analyse des flux existants :
- Évaluer les pipelines (batch/stream, orchestrations, modèles) et identifier les goulots d’étranglement en termes de coût et de performance.
- Définir une architecture cible basée sur Delta Lake, Databricks Jobs/Workflows et modèles dbt.
- Réécriture et replatforming :
- Moderniser les pipelines (Kubernetes, Airflow, Spark, SQL) et migrer les modèles vers dbt en appliquant :
- Conventions de nommage claires
- Tests automatisés
- Documentation technique exhaustive
- Intégrer les actifs dans Unity Catalog :
- Gestion des RBAC/ACL et masquage des données (PII)
- Structuration des catalogues/schémas
- Audit des accès et des lignages
2. DataOps & fiabilité des pipelines
- Robustesse et résilience :
- Concevoir des systèmes tolérants aux pannes pour l’ingestion et le traitement des données.
- Mettre en place des mécanismes de réessai/backoff, gestion des dépendances et conformité aux SLAs.
- CI/CD des données :
- Intégrer des tests dbt dans les PR, linting et vérifications de schéma pour une livraison continue.
- Automatiser les workflows avec des outils comme Databricks Workflows ou Airflow.
- Observabilité et alertes :
- Déployer une observabilité de bout en bout :
- Métriques de performance des pipelines
- Surveillance de la fraîcheur des données
- Couverture des tests
- Configurer des alertes (ex. : Datadog) avec des playbooks et des objectifs de MTTR (Mean Time To Repair).
- Définir et surveiller les contrats de données et SLOs avec les équipes consommatrices.
- Documentation et gouvernance :
- Tenir à jour un catalogue des données, les définitions métriques et les journaux de modifications.
- Créer des runbooks standardisés pour les audits et déploiements.
3. Amélioration continue (Performance & Coûts)
- Optimiser les tâches/tables Delta :
- Partitionnement, ZOrder, commandes OPTIMIZE, et autoscaling.
- Surveillance proactive des coûts/performances (budgets, rentabilité par pipeline).
4. Collaboration & Enablement
- Travail transversal :
- Collaborer avec les équipes Data Science, Infrastructure, Software, Produit et Conseil pour comprendre et répondre aux besoins en données.
- Travailler avec les Client Analytics Engineers pour traduire les exigences des retailers en modèles fiables et maintenables.
- Partage des bonnes pratiques :
- Diffuser les bests practices (modèles dbt, guides d’intégration, checklists qualité).
- Former les équipes à l’interrogation SQL dans Databricks et animer des sessions sur le Data Domain.
Vos responsabilités opérationnelles
- Migration des pipelines :
- Appliquer les directives pour migrer les flux ELT vers Databricks (Jobs/Workflows, Spark/SQL) et les modèles dbt, incluant tests et documentation.
- Standardisation technique :
- Créer des blocs de code réutilisables pour l’équipe.
- Gérer les PRs acceptées afin de réduire la dette technique.
- Observabilité et réduction des MTTR :
- Déployer des dashboards Datadog et des alertes pour une détection rapide des anomalies.
- Élaborer des runbooks exploitables pour accélérer les résolutions.
- Gestion des données dans Unity Catalog :
- Administrer les catalogues/schémas/tables, lignages, accès et masquage des données pour garantir sécurité et conformité.
- Surveillance des données :
- Piloter les contrats de données et SLOs.
- Surveiller la fraîcheur, qualité et dérive des schémas.
- Documentation et accélération :
- Maintenir une documentation claire et fournir des modèles pour faciliter les migrations futures.
Profil recherché :
- Expertise confirmée en Data Platform Engineering, DataOps et Big Data (Databricks, dbt, Delta Lake).
- Maîtrise des outils d’orchestration (Airflow, Kubernetes) et des langages SQL/Python.
- Sens aigu de la gouvernance des données, de l’observabilité et de la qualité.
- Capacité à collaborer avec des équipes multi-disciplinaires et à former les utilisateurs.
Pour postuler :
Envoyer votre candidature à [adresse e-mail ou lien d’application].