- CDI
- Localisation : Paris
- 1 à 2 jours télétravail / semaine
- Rémunération entre 43 000 et 57 000 euros brut annuel
À quoi ressemblera votre journée :
- Concevoir, développer et mettre en oeuvre des pipelines ETL/ELT robustes et performants pour ingérer, transformer et charger des données structurées et non structurées.
- Développer des solutions de traitement de données à grande échelle en utilisant Scala et PySpark sur les environnements GCP (CF, Cloud run, Dataproc, BigQuery, Cloud Storage) et/ou Cloudera (HDFS, Spark, Hive, Ranger, kerberos).
- Participer à la conception et à l'évolution de l'architecture de données, en assurant la cohérence, la performance et la sécurité.
- Optimiser les requêtes et les performances des jobs de traitement de données.
- Mettre en place et maintenir des processus de qualité des données et de monitoring.
- Collaborer étroitement avec les architectes, le Techlead, les Analystes de données et les autres parties prenantes pour comprendre leurs besoins et y répondre efficacement.
- Écrire du code propre, maintenable et bien documenté.
- Participer aux revues de code et aux bonnes pratiques de développement.
- Assurer le déploiement, la configuration et la maintenance des outils et plateformes de données.
- Résoudre les problèmes techniques liés aux flux de données et aux plateformes.