Hugging Face : le backend transformers dans vLLM fonctionne désormais à vitesse native
Le 8 juillet 2026, Hugging Face a annoncé la parité de performances du backend transformers dans vLLM : avec un seul flag `--model-impl transformers`, l'inférence ne cède plus face aux implémentations natives. Le test sur trois Qwen3 — 4B (1 GPU), 32B (2 GPU) et 235B MoE sur 8×H100 — est au même niveau ou meilleur dans tous les cas. Plus de 450 architectures sont prises en charge, et la possibilité de fine-tuning est conservée.
Traité par IA depuis Hugging Face Blog ; édité par Hamidun News
Le 8 juillet 2026, Hugging Face a publié les résultats de benchmarks sur son blog : le backend de la bibliothèque transformers dans vLLM correspond maintenant entièrement aux implémentations natives de vLLM en performance pour les architectures compatibles — les développeurs ne doivent que ajouter un seul drapeau `--model-impl transformers` lors du lancement du serveur, sans changements d'infrastructure.
Ce qui a changé pour les développeurs
Auparavant, l'inférence haute performance dans vLLM nécessitait des implémentations « manuelles » séparées pour chaque architecture. La version de recherche d'un modèle dans transformers et sa version de production dans vLLM divergeaient et nécessitaient la synchronisation de deux bases de code à chaque mise à jour d'architecture.
Maintenant, la bibliothèque transformers compile automatiquement en noyaux vLLM optimisés via `torch.fx` (analyse de graphe statique) et manipulations AST pour la réécriture d'opérations. Sous le capot, le système construit un graphe de calcul, recherche les motifs à remplacer par un noyau unique optimisé, et pour les modèles avec parallélisme tensoriel fusionne en outre les couches parallèles de colonne et QKV.
Faits clés :
- Date : 8 juillet 2026, blog officiel de Hugging Face
- Drapeau de lancement : `--model-impl transformers` dans la commande `vllm serve`
- Modèles de test : Qwen3-4B (1 GPU), Qwen3-32B (2 GPU, parallélisme tensoriel), Qwen3-235B MoE FP8 (8×H100)
- Résultat : le backend égale ou surpasse vLLM natif en débit
- Compatibilité : `torch.compile`, CUDA Graphs, support d'entraînement (absent dans les implémentations natives de vLLM)
- Couverture : 450+ architectures dans la bibliothèque transformers
Comment le test a été effectué en pratique
Hugging Face a évalué trois configurations Qwen3, s'escaladant en complexité : Qwen3-4B sur un seul GPU, Qwen3-32B avec parallélisme tensoriel sur deux GPU, et Qwen3-235B au format FP8 avec architecture Mixture-of-Experts sur huit H100 avec parallélisme de données et parallélisme d'experts simultanés. Sur les trois configurations, le backend transformers a affiché un débit égal ou supérieur à vLLM natif.
«
Les développeurs peuvent maintenant obtenir une inférence vLLM ultra-rapide gratuitement », — du blog officiel de Hugging Face.
Un avantage important par rapport aux implémentations natives de vLLM : le backend transformers préserve le support d'entraînement. Les implémentations natives de vLLM ont été conçues exclusivement pour l'inférence — les équipes ayant besoin à la fois du fine-tuning et du service haute performance devaient auparavant maintenir deux chemins de code distincts.
Pourquoi c'est important pour l'écosystème
La bibliothèque transformers sert de mise en œuvre de référence pour 450+ architectures et est intégrée dans SGLang, MLX et llama.cpp. La parité avec vLLM natif élimine l'un des arguments clés contre son utilisation en production — la nécessité de réécrire les modèles pour un moteur d'exécution spécifique. C'est particulièrement significatif dans le contexte de fragmentation : chaque moteur auparavant nécessitait sa propre implémentation.
Le chemin de la publication d'un nouveau modèle sur Hugging Face Hub au déploiement haute performance se raccourcit considérablement. Les développeurs n'ont plus besoin d'attendre que l'équipe vLLM ajoute le support natif de l'architecture — un drapeau et une implémentation compatible de transformers suffisent. Ceci est particulièrement important pour les chercheurs indépendants et les petites équipes sans ressources pour écrire et maintenir des implémentations vLLM séparées.
Limitations actuelles : les modèles avec attention linéaire ne sont pas encore supportés ; les modèles personnalisés des dépôts Hub peuvent rencontrer des problèmes de compatibilité.
Ce que cela signifie
La barrière entre le code de recherche dans transformers et l'inférence de production dans vLLM a pratiquement disparu. Ce qui autrefois nécessitait une optimisation manuelle pour chaque moteur est maintenant réalisé avec un seul drapeau de ligne de commande — réduction directe des coûts d'ingénierie pour les équipes développant et déployant de grands modèles de langage.
Questions Fréquemment Posées
Quels modèles le nouveau backend supporte-t-il ?
Le backend supporte 450+ architectures de la bibliothèque transformers. Testé sur Qwen3-4B, Qwen3-32B et Qwen3-235B MoE FP8. Les modèles avec attention linéaire ne sont pas supportés dans la version actuelle ; les modèles personnalisés du Hub peuvent nécessiter une vérification de compatibilité.
Comment exécute-t-on vLLM avec le backend transformers ?
Pour une GPU : `vllm serve Qwen/Qwen3-4B --model-impl transformers`. Pour plusieurs GPU : `vllm serve Qwen/Qwen3-32B --model-impl transformers --tensor-parallel-size 2`. Aucune autre modification d'infrastructure n'est requise.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.