Taux journalier (TJM): TJM 455 EUR/jour
Mission de Data Engineering au sein d'un grand compte du secteur de l'énergie, sur le projet NEXUS. Le consultant interviendra dans un environnement Big Data distribué mobilisant des technologies Hadoop, Spark et Scala, avec des bases de données PostgreSQL et Teradata. La mission s'inscrit dans un cadre hybride basé à Lyon, pour une durée initiale de 6 mois fermes reconductibles.
- Concevoir et développer des pipelines de traitement de données en Scala et Apache Spark
- Intégrer et exploiter des sources de données issues de Teradata et PostgreSQL
- Mettre en place et maintenir les pipelines CI/CD via GitLab CI
- Automatiser les déploiements et la configuration des environnements avec Ansible
- Développer des composants complémentaires en Java et Python selon les besoins du projet
- Assurer la qualité et la fiabilité des flux de données dans l'écosystème Hadoop
- Documenter les développements et suivre les travaux via Jira et Confluence
- Collaborer avec les équipes projet en mode hybride et contribuer aux revues de code via Git
- Scala (développement de pipelines Big Data)
- Apache Spark (traitement distribué de données à grande échelle)
- Java (développement de composants applicatifs)
- Python (scripting et traitement de données)
- PostgreSQL (requêtes et manipulation de données relationnelles)
- Teradata (exploitation de bases de données analytiques)
- Hadoop (écosystème de traitement distribué)
- GitLab CI (intégration et déploiement continus)
- Ansible (automatisation et gestion de configuration)
- Jira / Confluence (suivi de projet et documentation)
- Git (gestion de versions et revue de code)
- Kafka ou autre broker de messages (streaming de données)
- Hive ou HBase (requêtage sur écosystème Hadoop)
- Docker / Kubernetes (conteneurisation et orchestration)
- Airflow (orchestration de pipelines de données)
- Expérience en environnement réglementé ou secteur de l'énergie
- Anglais technique (lecture de documentation et échanges)
Data Engineer confirmé justifiant d'une expérience entre 3 et 6 ans, avec une maîtrise avérée des technologies Big Data (Scala, Spark, Hadoop) et une bonne connaissance des bases de données relationnelles et analytiques (PostgreSQL, Teradata). Le candidat devra faire preuve d'autonomie, de rigueur dans la gestion des pipelines de données et d'une capacité à s'intégrer rapidement dans un environnement projet structuré. Un bon sens de la communication et une aptitude à travailler en mode hybride avec des équipes pluridisciplinaires sont attendus.