Basé sur 38 offres pour ce poste (Top profil, France, 3 dernières semaines). Fourchette habituelle 48k€–63k€, médiane 54k€. Cette offre (88k€) est au-dessus de la fourchette.
Serving et Runtime des modèles : Concevoir et optimiser la plateforme de serving basée sur vLLM, configurer le parallélisme selon l'architecture du modèle et l'interconnexion de l'infrastructure cible, et installer/maintenir llm-d pour l'inférence distribuée et désagrégée (prérem...
Un plan personnalisé pour postuler intelligemment à cette offre.
Cliquez sur "Postuler" pour accéder à l'offre.