Taux journalier (TJM): TJM 475 EUR/jour
Mission de conception et développement Big Data au sein de la DSI d'un grand compte du Transport ferroviaire, sur un périmètre Data/BI. Le consultant interviendra sur des travaux de développement de pipelines de données et d'exploitation de plateformes distribuées, en environnement Azure et Databricks. La mission s'inscrit dans un cadre hybride basé à Paris 12, pour une durée initiale d'un an ferme.
- Concevoir et développer des pipelines de traitement de données en PySpark et Python sur la plateforme Databricks
- Écrire et optimiser des requêtes SQL et Hive pour l'exploitation des données Big Data
- Développer et maintenir des scripts d'automatisation en Bash
- Intégrer et déployer les développements dans l'environnement cloud Azure
- Gérer les versions du code source et contribuer aux revues de code via Git
- Concevoir et alimenter des tableaux de bord et rapports dans Power BI
- Participer à la conception technique des architectures de traitement de données
- Assurer la qualité et la performance des traitements Big Data développés
- Apache Spark / PySpark (développement de pipelines de traitement distribué)
- Python (développement de scripts et traitements de données)
- SQL (requêtes complexes et manipulation de données)
- Databricks (conception et exécution de notebooks et jobs)
- Azure (déploiement et exploitation de services cloud Data)
- Hive (requêtage et gestion de données en environnement Hadoop/Lakehouse)
- Bash (scripting et automatisation)
- Git (gestion de versions et collaboration)
- Power BI (conception de rapports et tableaux de bord)
- Delta Lake (gestion de données transactionnelles sur Databricks)
- Azure Data Factory ou Azure Synapse (orchestration de pipelines)
- Pratique des méthodologies Agile / Scrum
- Connaissance des architectures Lakehouse ou Medallion
- Automatisation de tests de pipelines de données (pytest, Great Expectations)
- Expérience sectorielle dans le transport ou les services publics
- Anglais technique (lecture de documentation)
Concepteur-développeur Big Data senior avec minimum 8 ans d'expérience, dont une maîtrise avérée de l'écosystème Spark/PySpark, Databricks et Azure. Le candidat doit démontrer une capacité à intervenir de manière autonome sur des sujets de conception et de développement de pipelines de données complexes, dans un environnement projet structuré. Rigueur, autonomie et capacité à s'intégrer dans une équipe DSI de grand compte sont attendues.