OmDev Logo
GetYourJob
0
Publié hier

Data Engineer PySpark (H/F)

Entreprise
Localisation
Paris, France
Hybride
Type de contrat
CDI ou Freelance
Niveau
Senior
Rémunération
45–50 k€/an• Salaire annuel

Salaire du marché

Médiane du marché
52k€
Dans le marché
43k€fourchette habituelle58k€
Cette offre : 48k€

Basé sur 19 offres pour ce poste (Senior, Île-de-France, 3 dernières semaines). Fourchette habituelle 43k€–58k€, médiane 52k€. Cette offre (48k€) est dans la fourchette.

Médiane du marché
500€/j
Estimation
450€/jfourchette habituelle550€/j

Cette offre n'affiche pas de TJM. D'après 30 offres pour ce poste (Senior, Île-de-France), le marché se situe autour de 500€/j (450€/j–550€/j).

TJM du marché pour Data Engineer (Senior) en région Île-de-France : médiane 500 €/jour, P25–P75 : 450–550 €/jour, n = 30 offres. TJM Python à Paris

Salaire du marché pour Data Engineer (Senior) en région Île-de-France : médiane 51 500 €/an, P25–P75 : 42 500–58 000 €/an, n = 19 offres. Salaire Python à Paris

Baromètre TJM et salaires IT

Description du poste

Nous recherchons un Data Engineer confirmé pour rejoindre l'équipe de la Direction des Systèmes d'Information au sein d'un grand groupe industriel. Vous serez responsable de la conception, du développement et de la maintenance d'un datalake stratégique, en travaillant étroitement avec les équipes de production applicative et DevOps pour mettre en œuvre des solutions de traitement de données robustes et performantes.

Votre mission s'inscrit dans un environnement technologique moderne et agile. Vous participerez à l'évolution continue d'une plateforme données complexe, contribuerez à l'architecture des pipelines ETL et assurerez la qualité et la fiabilité des ingestions de données. L'environnement de travail est collaborative, dynamique et fondé sur les bonnes pratiques d'ingénierie logicielle (versioning, intégration continue, tests automatisés).

Le datalake traite des volumes de données significatifs et nécessite une expertise technique pointue. Vous aurez l'occasion de travailler sur des sujets variés : conception de schémas de données, optimisation des performances, debugging en environnement distribué, et exploration de nouvelles technologies pour améliorer la stack existante.

Responsabilités :
- Mettre en œuvre et industrialiser de nouvelles ingestions de données, en respectant les standards de qualité et de performance du datalake
- Concevoir et développer des transformations de données complexes en PySpark et Hive, optimisées pour les environnements Hadoop
- Maintenir, documenter et faire évoluer les outils et scripts de gestion des pipelines de données (PySpark, shell scripting Unix/Linux)
- Collaborer avec l'équipe DevOps pour l'évolution et l'optimisation de l'infrastructure de la plateforme données
- Rédiger des spécifications techniques détaillées et participer à la validation des livrables avec les parties prenantes
- Identifier et proposer des améliorations technologiques pour maintenir la compétitivité de la plateforme
- Travailler en méthodologie Agile/Scrum, participer aux cérémonies d'équipe et contribuer à l'amélioration continue
- Assurer le debugging et la résolution d'incidents en production, en coordination avec les équipes de support

Profil recherché

Indispensables :
- Maîtrise experte de PySpark et de la plateforme Hadoop (architecture, écosystème, déploiement)
- Très bonne maîtrise de Python, avec capacité à écrire du code production performant et maintenable
- Très bonne maîtrise de SQL et de Hive, incluant l'optimisation de requêtes et la gestion des tables distribuées
- Solide expérience du shell scripting sous environnement Unix/Linux pour l'automatisation et la gestion des pipelines
- Pratique confirmée de Git, Jenkins et des outils de gestion de projet (Jira ou équivalent)
- Expérience en environnement Agile/Scrum, avec capacité à s'adapter à un rythme de travail itératif
- Très bonne maîtrise de l'anglais, écrit et oral, pour collaborer avec des équipes distribuées
- Capacité à rédiger des spécifications techniques claires, précises et facilement compréhensibles
- Autonomie, proactivité et capacité à résoudre des problèmes complexes de manière indépendante
- Excellent relationnel et forte capacité à travailler en équipe multidisciplinaire

Fortement appréciés :
- Expérience avec des outils de traitement de données alternatifs ou complémentaires : Alteryx, Indexima, Altair
- Connaissance de Google Cloud Platform (GCP) et de BigQuery, ou expérience sur des solutions cloud de big data
- Maîtrise de bibliothèques Python avancées pour les API et l'intégration de systèmes (requests, pandas, pyspark-sql)
- Expérience dans la conception et l'optimisation d'architectures ETL à grande échelle
- Sensibilité aux bonnes pratiques de data governance, de sécurité des données et de qualité
- Curiosité technique et intérêt manifeste pour explorer et évaluer de nouvelles technologies
- Expérience avec des outils de monitoring et de logging en environnement distribué

Exigences du poste

Compétences requises

  • PySpark

Un plus

  • Data Lake
  • DevOps
  • Agile
  • ETL
  • QA Testing
  • Apache Hive
  • Hadoop
  • Bash
  • Unix
  • Linux Administration
  • Scrum
  • Agile Ceremonies

Toutes les offres Python à Paris

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

À propos de l'entreprise

Signe + en quelques mots : Spécialiste en intermédiation sur le marché IT, SAP, Data BI, Cyber nous intervenons en France comme à l’étranger en sous-traitance, recrutement et également en portage salarial, portage commercial ou portage de formation Qualiopi. Signe + crée de manière équilibrée de la valeur pour toutes les parties prenantes en s’appuyant sur une connaissance dynamique du marché avec une plateforme évolutive de plus de 150 000 profils. Depuis 2005, nous accompagnons nos clients avec nos valeurs : ✔ Expertise et professionalisme ✔ Agilité et Innovation ✔ Transparence et éthique ✔ Proximité et accessibilité

Voir toutes les offres de Signe +

Publié par

Recruteur
Recruteur

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.