Contexte
Le bénéficiaire souhaite une prestation d’accompagnement dans l’objectif d’assurer une mission dans le cadre de sa transition vers une architecture Data Mesh. Nous recherchons un(e) Data Product Engineer spécialisé(e) dans le développement de pipelines sur la plateforme Talend Real Time BigData et de data products sur la plateforme Starburst.
Missions
- Conception de flux de données et de Data Products
- Développement des pipelines d'intégration de données optimisés via la Talend Data Fabric / Talend Real Time BigData ou encore Spark / Astronomer
- Documentation des pipelines d'ingestion de données
- Intégration des données dans l’écosystème Data Mesh
- Collaboration avec les domaines métiers pour identifier les sources de données et les cas d’usage
- Développement des data products / data sets (vues & vues matérialisées) répondant à des cas d'usage identifiées avec les responsables de domaines métiers
- Développement des requêtes SQL optimisées pour Starburst (push-down predicates, partitionnement, formats de fichiers comme Iceberg/Parquet)
- Documentation des data products (métadonnées, ownership, qualité)
- Contribution à l’amélioration continue des data products dans la plateforme Starburst
- Mise en place des alertes et des dashboards pour le suivi des data products
Outils & Environnement
- Apache Spark
- Talend (Talend RealTime BigData, Talend Studio)
- Starburst / Trino
- Airflow / Astronomer
- Formats de stockage : Iceberg, Parquet, S3
- Outils de gouvernance : Ranger, RBAC
- Pratiques DevOps/DataOps : CI/CD, infrastructure-as-code (Terraform, Kubernetes)
- Langages : SQL avancé, Python (Pandas, PySpark), bash
Conditions de travail
- Lieu de la mission : Paris
- Démarrage : ASAP
- Mission de longue durée
- Télétravail : 2 jours par semaine
- Anglais professionnel obligatoire
- Séniorité requise : 8 à 10 ans d’expérience minimum