Hugging Face: backend de transformers no vLLM agora roda em velocidade nativa
Em 8 de julho de 2026, a Hugging Face anunciou paridade de desempenho do backend de transformers no vLLM: uma única flag `--model-impl transformers` faz com que a inferência não fique atrás das implementações nativas. O teste com três Qwen3 — 4B (1 GPU), 32B (2 GPU) e 235B MoE em 8×H100 — ficou no mesmo nível ou melhor em todos os casos. Há suporte para mais de 450 arquiteturas, com a possibilidade de fine-tuning preservada.
Processado por IA de Hugging Face Blog; editado por Hamidun News
Em 8 de julho de 2026, Hugging Face publicou resultados de benchmarks em seu blog: o backend da biblioteca transformers em vLLM agora corresponde completamente às implementações nativas de vLLM em desempenho para arquiteturas compatíveis — os desenvolvedores apenas precisam adicionar um único sinalizador `--model-impl transformers` ao iniciar o servidor, sem alterações de infraestrutura.
O que mudou para os desenvolvedores
Anteriormente, inferência de alto desempenho em vLLM exigia implementações "manuais" separadas para cada arquitetura. A versão de pesquisa de um modelo em transformers e sua versão de produção em vLLM divergiam e exigiam sincronizar duas bases de código com cada atualização de arquitetura.
Agora a biblioteca transformers compila automaticamente em kernels vLLM otimizados via `torch.fx` (análise de gráfico estático) e manipulações de AST para reescrita de operações. Sob o capô, o sistema constrói um gráfico de computação, procura por padrões para substituir por um kernel otimizado único, e para modelos com paralelismo tensorial além disso funde camadas paralelas de coluna e QKV.
Fatos-chave:
- Data: 8 de julho de 2026, blog oficial de Hugging Face
- Sinalizador de lançamento: `--model-impl transformers` no comando `vllm serve`
- Modelos de teste: Qwen3-4B (1 GPU), Qwen3-32B (2 GPU, paralelismo tensorial), Qwen3-235B MoE FP8 (8×H100)
- Resultado: backend iguala ou supera vLLM nativo em throughput
- Compatibilidade: `torch.compile`, CUDA Graphs, suporte de treinamento (ausente em implementações nativas de vLLM)
- Cobertura: 450+ arquiteturas na biblioteca transformers
Como o teste foi realizado na prática
Hugging Face avaliou três configurações Qwen3, escalando em complexidade: Qwen3-4B em uma única GPU, Qwen3-32B com paralelismo tensorial em duas GPU, e Qwen3-235B em formato FP8 com arquitetura Mixture-of-Experts em oito H100 com paralelismo de dados e paralelismo de especialista simultâneos. Em todas as três configurações, o backend transformers mostrou throughput igual ou superior ao vLLM nativo.
"Os desenvolvedores agora podem obter inferência ultra-rápida de vLLM gratuitamente", — do blog oficial de
Hugging Face.
Uma vantagem importante sobre implementações nativas de vLLM: o backend transformers preserva suporte de treinamento. Implementações nativas de vLLM foram projetadas exclusivamente para inferência — equipes precisando tanto de fine-tuning quanto de servimento de alto desempenho anteriormente tinham que manter dois caminhos de código separados.
Por que isso importa para o ecossistema
A biblioteca transformers serve como implementação de referência para 450+ arquiteturas e é integrada em SGLang, MLX e llama.cpp. Paridade com vLLM nativo elimina um dos argumentos-chave contra seu uso em produção — a necessidade de reescrever modelos para um mecanismo de servimento específico. Isto é especialmente significativo no contexto de fragmentação: cada mecanismo anteriormente exigia sua própria implementação.
O caminho de publicar um novo modelo no Hugging Face Hub para deployment de alto desempenho se encurta substancialmente. Desenvolvedores não precisam mais esperar a equipe de vLLM adicionar suporte nativo de arquitetura — um sinalizador e implementação compatível de transformers são suficientes. Isto é especialmente importante para pesquisadores independentes e pequenas equipes sem recursos para escrever e manter implementações vLLM separadas.
Limitações atuais: modelos com atenção linear não são ainda suportados; modelos customizados de repositórios Hub podem encontrar problemas de compatibilidade.
O que isso significa
A barreira entre código de pesquisa em transformers e inferência de produção em vLLM praticamente desapareceu. O que uma vez exigia otimização manual para cada mecanismo agora é alcançado com um único sinalizador de linha de comando — redução direta em custos de engenharia para equipes desenvolvendo e implantando grandes modelos de linguagem.
Perguntas Frequentes
Quais modelos o novo backend suporta?
O backend suporta 450+ arquiteturas da biblioteca transformers. Testado em Qwen3-4B, Qwen3-32B e Qwen3-235B MoE FP8. Modelos com atenção linear não são suportados na versão atual; modelos customizados do Hub podem exigir verificação de compatibilidade.
Como executo vLLM com o backend transformers?
Para uma GPU: `vllm serve Qwen/Qwen3-4B --model-impl transformers`. Para múltiplas GPU: `vllm serve Qwen/Qwen3-32B --model-impl transformers --tensor-parallel-size 2`. Nenhuma outra alteração de infraestrutura é requerida.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.