Basé sur 11 offres pour ce poste (tous niveaux, Lyon, 3 dernières semaines). Fourchette habituelle 400€/j–470€/j, médiane 450€/j. Cette offre (500€/j) est au-dessus de la fourchette.
Nous recherchons pour un client un Developpeur DATA Python pour travailler sur une plateforme Hadoop.
L'objectif est de réaliser et maintenir les développements nécessaires à l'alimentation de la plateforme Hadoop, à la mise en place d'extractions et à l'accompagnement des utilisateurs.
Les missions seront :
de prendre en charge les évolutions des données à intégrer, reprendre les développements effectués pour l'alimentation du Datalake , de les faire évoluer en fonction des besoins (Stack technique : Hadoop Cloudera, Hive, Impala, Python, Shell, Linux, SQL, VBA, Jupiter)
- d'assurer un rôle de lead tech : spécifier techniquement les tâches, fournir les requêtes de référence, effectuer une revue de code, accompagner les potentiels alternants ou stagiaires (une alternante à date)
- de mettre en place des extractions à partir de ces données,
- d’assurer le support niveau 2,
- de faire appliquer les consignes aux utilisateurs,
- de garantir la tenue des délais de livraison dans un contexte de production à fortes attentes
- de contribuer à garantir la maintenabilité de la plateforme ainsi que ses performances et son exploitabilité
Compétences Techniques :
- création d'arborescence
- copie de fichier vers hadoop
- lancement d'un spark-submit avec les bons paramètres / tunning
- Lire et comprendre du shell
Python : Python pour faire du scripting + nettoyage de données
PySpark : Savoir développer une pipeline de données avec des jointures, du paramétrage (braodcast, repartition, coalesce)
Différence entre spark2 et 3
SQL : Connaissance d'un CTE et requete
Hadoop : Utilisation de Hive, comprendre la différence entre une table externe et managée,
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.