Hugging Face Blog→ original

Hugging Face: backend de transformers no vLLM agora roda em velocidade nativa

Em 8 de julho de 2026, a Hugging Face anunciou paridade de desempenho do backend de transformers no vLLM: uma única flag `--model-impl transformers` faz com que a inferência não fique atrás das implementações nativas. O teste com três Qwen3 — 4B (1 GPU), 32B (2 GPU) e 235B MoE em 8×H100 — ficou no mesmo nível ou melhor em todos os casos. Há suporte para mais de 450 arquiteturas, com a possibilidade de fine-tuning preservada.

Processado por IA de Hugging Face Blog; editado por Hamidun News
Hugging Face: backend de transformers no vLLM agora roda em velocidade nativa
Fonte: Hugging Face Blog. Colagem: Hamidun News.
◐ Ouvir artigo

Em 8 de julho de 2026, Hugging Face publicou resultados de benchmarks em seu blog: o backend da biblioteca transformers em vLLM agora corresponde completamente às implementações nativas de vLLM em desempenho para arquiteturas compatíveis — os desenvolvedores apenas precisam adicionar um único sinalizador `--model-impl transformers` ao iniciar o servidor, sem alterações de infraestrutura.

O que mudou para os desenvolvedores

Anteriormente, inferência de alto desempenho em vLLM exigia implementações "manuais" separadas para cada arquitetura. A versão de pesquisa de um modelo em transformers e sua versão de produção em vLLM divergiam e exigiam sincronizar duas bases de código com cada atualização de arquitetura.

Agora a biblioteca transformers compila automaticamente em kernels vLLM otimizados via `torch.fx` (análise de gráfico estático) e manipulações de AST para reescrita de operações. Sob o capô, o sistema constrói um gráfico de computação, procura por padrões para substituir por um kernel otimizado único, e para modelos com paralelismo tensorial além disso funde camadas paralelas de coluna e QKV.

Fatos-chave:

  • Data: 8 de julho de 2026, blog oficial de Hugging Face
  • Sinalizador de lançamento: `--model-impl transformers` no comando `vllm serve`
  • Modelos de teste: Qwen3-4B (1 GPU), Qwen3-32B (2 GPU, paralelismo tensorial), Qwen3-235B MoE FP8 (8×H100)
  • Resultado: backend iguala ou supera vLLM nativo em throughput
  • Compatibilidade: `torch.compile`, CUDA Graphs, suporte de treinamento (ausente em implementações nativas de vLLM)
  • Cobertura: 450+ arquiteturas na biblioteca transformers

Como o teste foi realizado na prática

Hugging Face avaliou três configurações Qwen3, escalando em complexidade: Qwen3-4B em uma única GPU, Qwen3-32B com paralelismo tensorial em duas GPU, e Qwen3-235B em formato FP8 com arquitetura Mixture-of-Experts em oito H100 com paralelismo de dados e paralelismo de especialista simultâneos. Em todas as três configurações, o backend transformers mostrou throughput igual ou superior ao vLLM nativo.

"Os desenvolvedores agora podem obter inferência ultra-rápida de vLLM gratuitamente", — do blog oficial de

Hugging Face.

Uma vantagem importante sobre implementações nativas de vLLM: o backend transformers preserva suporte de treinamento. Implementações nativas de vLLM foram projetadas exclusivamente para inferência — equipes precisando tanto de fine-tuning quanto de servimento de alto desempenho anteriormente tinham que manter dois caminhos de código separados.

Por que isso importa para o ecossistema

A biblioteca transformers serve como implementação de referência para 450+ arquiteturas e é integrada em SGLang, MLX e llama.cpp. Paridade com vLLM nativo elimina um dos argumentos-chave contra seu uso em produção — a necessidade de reescrever modelos para um mecanismo de servimento específico. Isto é especialmente significativo no contexto de fragmentação: cada mecanismo anteriormente exigia sua própria implementação.

O caminho de publicar um novo modelo no Hugging Face Hub para deployment de alto desempenho se encurta substancialmente. Desenvolvedores não precisam mais esperar a equipe de vLLM adicionar suporte nativo de arquitetura — um sinalizador e implementação compatível de transformers são suficientes. Isto é especialmente importante para pesquisadores independentes e pequenas equipes sem recursos para escrever e manter implementações vLLM separadas.

Limitações atuais: modelos com atenção linear não são ainda suportados; modelos customizados de repositórios Hub podem encontrar problemas de compatibilidade.

O que isso significa

A barreira entre código de pesquisa em transformers e inferência de produção em vLLM praticamente desapareceu. O que uma vez exigia otimização manual para cada mecanismo agora é alcançado com um único sinalizador de linha de comando — redução direta em custos de engenharia para equipes desenvolvendo e implantando grandes modelos de linguagem.

Perguntas Frequentes

Quais modelos o novo backend suporta?

O backend suporta 450+ arquiteturas da biblioteca transformers. Testado em Qwen3-4B, Qwen3-32B e Qwen3-235B MoE FP8. Modelos com atenção linear não são suportados na versão atual; modelos customizados do Hub podem exigir verificação de compatibilidade.

Como executo vLLM com o backend transformers?

Para uma GPU: `vllm serve Qwen/Qwen3-4B --model-impl transformers`. Para múltiplas GPU: `vllm serve Qwen/Qwen3-32B --model-impl transformers --tensor-parallel-size 2`. Nenhuma outra alteração de infraestrutura é requerida.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…