Hugging Face Blog→ original

Hugging Face: el backend de transformers en vLLM ya funciona a velocidad nativa

El 8 de julio de 2026, Hugging Face anunció la paridad de rendimiento del backend de transformers en vLLM: una sola flag `--model-impl transformers` y la inferencia ya no queda por detrás de las implementaciones nativas. La prueba con tres Qwen3 — 4B (1 GPU), 32B (2 GPU) y 235B MoE en 8×H100 — quedó al mismo nivel o mejor en todos los casos. Se admiten más de 450 arquitecturas y se mantiene la posibilidad de fine-tuning.

Procesado por IA desde Hugging Face Blog; editado por Hamidun News
Hugging Face: el backend de transformers en vLLM ya funciona a velocidad nativa
Fuente: Hugging Face Blog. Collage: Hamidun News.
◐ Escuchar artículo

El 8 de julio de 2026, Hugging Face publicó resultados de benchmarks en su blog: el backend de la biblioteca transformers en vLLM ahora coincide completamente con las implementaciones nativas de vLLM en rendimiento para arquitecturas compatibles — los desarrolladores solo necesitan agregar un único indicador `--model-impl transformers` al lanzar el servidor, sin cambios de infraestructura.

Qué cambió para los desarrolladores

Anteriormente, la inferencia de alto rendimiento en vLLM requería implementaciones "manuales" separadas para cada arquitectura. La versión de investigación de un modelo en transformers y su versión de producción en vLLM divergían y requerían sincronizar dos bases de código con cada actualización de arquitectura.

Ahora la biblioteca transformers se compila automáticamente en kernels vLLM optimizados a través de `torch.fx` (análisis de gráfico estático) y manipulaciones de AST para reescritura de operaciones. Bajo el capó, el sistema construye un gráfico de computación, busca patrones para reemplazarlos con un kernel optimizado único, y para modelos con paralelismo tensorial además fusiona capas paralelas de columnas y QKV.

Hechos clave:

  • Fecha: 8 de julio de 2026, blog oficial de Hugging Face
  • Indicador de lanzamiento: `--model-impl transformers` en comando `vllm serve`
  • Modelos de prueba: Qwen3-4B (1 GPU), Qwen3-32B (2 GPU, paralelismo tensorial), Qwen3-235B MoE FP8 (8×H100)
  • Resultado: el backend iguala o supera vLLM nativo en rendimiento
  • Compatibilidad: `torch.compile`, CUDA Graphs, soporte de entrenamiento (ausente en implementaciones nativas de vLLM)
  • Cobertura: 450+ arquitecturas en la biblioteca transformers

Cómo se realizó la prueba en la práctica

Hugging Face realizó benchmarks de tres configuraciones Qwen3, escalando en complejidad: Qwen3-4B en una GPU única, Qwen3-32B con paralelismo tensorial en dos GPU, y Qwen3-235B en formato FP8 con arquitectura Mixture-of-Experts en ocho H100 con paralelismo de datos y paralelismo de expertos simultáneos. En las tres configuraciones, el backend transformers mostró rendimiento igual o superior a vLLM nativo.

"Los desarrolladores ahora pueden obtener inferencia ultra-rápida de vLLM gratis", — del blog oficial de

Hugging Face.

Una ventaja importante sobre las implementaciones nativas de vLLM: el backend transformers preserva el soporte de entrenamiento. Las implementaciones nativas de vLLM fueron diseñadas exclusivamente para inferencia — los equipos que necesitan tanto fine-tuning como servicio de alto rendimiento anteriormente tenían que mantener dos rutas de código separadas.

Por qué importa para el ecosistema

La biblioteca transformers sirve como implementación de referencia para 450+ arquitecturas y está integrada en SGLang, MLX y llama.cpp. La paridad con vLLM nativo elimina uno de los argumentos clave contra su uso en producción — la necesidad de reescribir modelos para un motor de servicio específico. Esto es especialmente significativo en el contexto de fragmentación: cada motor previamente requería su propia implementación.

El camino desde publicar un nuevo modelo en Hugging Face Hub hasta deployment de alto rendimiento se acorta sustancialmente. Los desarrolladores ya no necesitan esperar a que el equipo de vLLM agregue soporte de arquitectura nativa — un indicador e implementación compatible de transformers son suficientes. Esto es especialmente importante para investigadores independientes y equipos pequeños sin recursos para escribir y mantener implementaciones vLLM separadas.

Limitaciones actuales: los modelos con atención lineal no son soportados aún; modelos personalizados de repositorios Hub pueden encontrar problemas de compatibilidad.

Qué significa

La barrera entre el código de investigación en transformers e inferencia de producción en vLLM ha desaparecido virtualmente. Lo que una vez requería optimización manual para cada motor ahora se logra con un único indicador de línea de comandos — reducción directa en costos de ingeniería para equipos que desarrollan y despliegan modelos de lenguaje grandes.

Preguntas Frecuentes

¿Qué modelos soporta el nuevo backend?

El backend soporta 450+ arquitecturas de la biblioteca transformers. Probado en Qwen3-4B, Qwen3-32B y Qwen3-235B MoE FP8. Los modelos con atención lineal no se soportan en la versión actual; modelos personalizados del Hub pueden requerir verificación de compatibilidad.

¿Cómo ejecuto vLLM con el backend transformers?

Para una GPU: `vllm serve Qwen/Qwen3-4B --model-impl transformers`. Para múltiples GPU: `vllm serve Qwen/Qwen3-32B --model-impl transformers --tensor-parallel-size 2`. No se requieren otros cambios de infraestructura.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…