Data Engineer – Plateforme Data AWS / Snowflake
Contexte
Dans le cadre de la transformation digitale d'un grand groupe industriel international, les équipes Data renforcent leur plateforme de valorisation des données afin d'améliorer l'exploitation des données internes et externes du groupe.
Cette plateforme permet notamment d'ingérer, traiter et mettre à disposition de larges volumes de données provenant de multiples fournisseurs et systèmes métiers afin d'alimenter différents cas d'usage : connaissance des marchés, analyse des usages produits et maintenance prédictive.
Dans ce contexte, une refonte et une migration de la plateforme Data vers une nouvelle architecture cloud sont engagées afin de simplifier l'architecture existante, améliorer la performance et réduire les coûts d'exploitation.
Le consultant intégrera une équipe Data organisée en mode Agile composée de Data Engineers, Data Scientists, Data Analysts et Product Owners, et interviendra sur la conception, l'industrialisation et l'optimisation des pipelines de traitement de données.
Environnement technique :
- AWS (S3, Lambda, API Gateway)
- Snowflake
- Airflow
- Terraform
- Gitlab CI/CD
- Formats Iceberg / Parquet
- Architecture Data Lake / Data Platform
- Traitement de données volumineuses
Localisation et conditions
- Localisation : Magny-les-Hameaux (78) + déplacements ponctuels Malakoff (92)
- Télétravail partiel : 2 jours / semaine
- Démarrage idéal : ASAP
Objectif de la mission
Le client recherche un Data Engineer confirmé capable de concevoir et d'industrialiser des pipelines de traitement de données dans un environnement cloud.
Le consultant interviendra sur les projets nécessitant l'ingestion, la transformation et la mise à disposition de volumes importants de données au sein de la plateforme Data du groupe.
Ses missions principales seront :
- Concevoir et maintenir les pipelines de traitement de données
- Structurer les modèles et formats de données
- Garantir la qualité et la cohérence des données intégrées dans la plateforme
- Automatiser les chaînes de traitement et les déploiements
- Accompagner les équipes Data dans l'exploitation et l'industrialisation des solutions
Le consultant participera également aux rituels Agile et contribuera à l'évolution de l'architecture et des bonnes pratiques de la plateforme Data.
Prestations attendues
Data Engineering & Architecture Data
- Cartographie et documentation des sources de données
- Conception et optimisation des pipelines de traitement de données
- Structuration des bases de données et des modèles de données
- Conception d'architectures de traitement de données à grande échelle
- Optimisation des flux et des performances de traitement
Intégration & Qualité des données
- Ingestion et stockage sécurisé de données externes
- Supervision des flux de données multi-sources
- Contrôle et amélioration de la qualité des données
- Nettoyage, transformation et validation des datasets
- Gestion des référentiels de données
Industrialisation & Automatisation
- Automatisation des pipelines de traitement de données
- Industrialisation des déploiements via CI/CD
- Orchestration des traitements avec Airflow
- Contribution à l'industrialisation des modèles et algorithmes ML
Gouvernance & Delivery
- Participation aux rituels Agile (daily, sprint planning, rétrospectives)
- Collaboration avec Data Scientists et Data Analysts
- Contribution aux standards et bonnes pratiques Data
- Suivi et reporting des activités
Livrables attendus
- Dossiers d'architecture Data
- Pipelines et services de traitement de données industrialisés
- Cartographie des sources et flux de données
- Documentation technique des pipelines et architectures
- Dispositifs de contrôle et de qualité des données
- Rapports d'activité et suivi des développements
Profil recherché
Expérience
- 5 à 10 ans d'expérience minimum en Data Engineering
- Expérience confirmée sur des plateformes Data Cloud
- Expérience dans le traitement de volumes importants de données
- Expérience dans des environnements techniques complexes
Compétences techniques indispensables
- AWS (S3, Lambda, API Gateway)
- Snowflake
- Airflow
- Terraform
- CI/CD (Gitlab)
- Traitement de données volumineuses
- Formats de données Iceberg / Parquet
- Conception de pipelines de traitement de données
Compétences techniques appréciées
- Architecture Data Lake / Data Platform
- Industrialisation des pipelines Data
- Expérience en environnement Cloud Data avancé
- Expérience sur plateformes analytiques
Compétences méthodologiques
- Conception de pipelines de données
- Modélisation et structuration des données
- Industrialisation et automatisation des traitements
- Documentation technique
- Travail en environnement Agile / Scrum
Soft skills
- Capacité d'analyse et de structuration
- Autonomie et proactivité
- Rigueur technique
- Capacité à collaborer avec des équipes Data pluridisciplinaires
- Communication claire et structurée