OmDev Logo
GetYourJob
0
Publié il y a 4 jours

Stage Pruning de Tokens Quantization-Aware pour Vision Transformers Embarqués -Saclay H/F

Entreprise
CEARecrute en direct
Localisation
Saclay - 91
Sur site
Type de contrat
Stage
Niveau
Junior
Rémunération
Pas de salaire renseigné

Description du poste

Description du poste :

Les Vision Transformers (ViT) atteignent d'excellentes performances sur de nombreuses tâches de vision, mais leur coût de calcul et leur empreinte mémoire compliquent leur déploiement sur des plateformes embarquées. Parmi les techniques permettant de réduire leur complexité, le pruning de tokens [1] vise à supprimer dynamiquement les tokens les moins informatifs, tandis que la quantification [2] réduit la précision numérique des poids et des activations. Ces deux approches sont cependant généralement étudiées séparément alors qu'elles sont complémentaires plutôt que concurrentes. Des travaux récents montrent qu'elles peuvent être fortement interdépendantes et gagner à être conçues conjointement [3,4].

Qu'attendons-nous de vous ?

L'objectif de ce stage est de développer une méthode de pruning de tokens quantization-aware et hardware-aware. Le travail consistera d'abord à caractériser l'impact de la quantification sur la sélection et l'importance des tokens, puis à développer une stratégie de pruning tenant compte à la fois de leur contribution à la tâche et de leur sensibilité à la basse précision. L'objectif sera ainsi d'étudier la co-optimisation du pruning et de la quantification plutôt que leur application indépendante.

La dimension hardware-aware visera à transformer les réductions de complexité algorithmique en gains réels sur la plateforme cible, notamment en termes de latence et d'empreinte mémoire. La granularité du pruning, la structure des tenseurs, le budget de tokens ainsi que le caractère dynamique ou statique de la stratégie seront étudiés en fonction de leur efficacité d'exécution et de leur compatibilité avec les kernels et le compilateur.

Les développements seront intégrés dans Aidge, la plateforme de deep learning développée au laboratoire pour l'optimisation et le déploiement de réseaux de neurones sur systèmes embarqués. Le travail comprendra l'étude de l'état de l'art, le développement et l'intégration des méthodes proposées, puis leur validation sur cible en termes de précision, complexité, latence, empreinte mémoire et surcoût du pruning.

Références:

[1] Bercy, V., Poreba, M., Szczepanski, M., Bouchafa, S.: G2TM: Single-module graph-guided token merging for efficient semantic segmentation. In: Proceedings of the 21st International Conference on Computer Vision Theory and Applications (VISAPP), pp. 43-54. (2026).

[2] Sassoon, J., Szczepanski, M., Poreba, M.: I-Segmenter: Integer-only Vision Transformer for efficient semantic segmentation. Journal of Systems Architecture 178, 103888 (2026).

[3] Wang, X., Xia, Z., Lin, Z., Li, Z., Wang, Y.: QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models. (2026). arXiv:2604.02816.

[4] Fan, X., Ma, Y., Chen, Z., Liu, H.: A Hardware Efficient Joint Compression Framework for Vision Transformers. IEEE Access, vol. 14, (2026).

#Cea List

Exigences du poste

Compétences requises

  • Python
  • PyTorch
  • TensorFlow
  • Vision Transformers (ViT)
  • Token Pruning
  • Quantization
  • Deep Learning
  • Systèmes embarqués
  • Hardware-Aware Optimization
  • Semantic Segmentation
  • Model Compression
  • Aidge

Un plus

  • Computer Vision
  • LLM

Toutes les offres Python à Paris

Plan d'action

Un plan personnalisé pour postuler intelligemment à cette offre.

À propos de l'entreprise

CEARecrute en direct
Voir toutes les offres de CEA

Publié par

Recruteur
Recruteur

Intéressé par cette offre ?

Cliquez sur "Postuler" pour accéder à l'offre.