DeLS-Spec acelerou a inferência de LLM sem retreinar modelos
O novo método DeLS-Spec acelera a geração de texto de modelos de linguagem grande. Sua característica principal: um adaptador leve treinado independentemente do modelo, sem retreinamento de modelo. Testes em modelos Qwen3 mostraram melhorias de velocidade para tarefas de matemática, código e diálogo.
Processado por IA de arXiv cs.CL; editado por Hamidun News
Pesquisadores propuseram DeLS-Spec—um novo método para acelerar a geração de texto em modelos de linguagem. A abordagem permite pela primeira vez alcançar aceleração significativa sem a necessidade de retreinar os modelos mesmos, o que reduz substancialmente as barreiras para adotar tais otimizações.
Como Funciona a Decodificação Especulativa
Decodificação especulativa é uma técnica que acelera a inferência de LLM gerando múltiplos tokens em paralelo em vez de um por vez. Um pequeno modelo de rascunho prevê tokens candidatos e o modelo principal verifica sua correção em uma única passagem. Se a previsão correspondeu—tokens são aceitos; se não, o processo se repete.
Métodos mais avançados, como DFlash, geram um bloco inteiro de tokens em uma única passagem, acelerando ainda mais o processo. Mas isto cria um problema: tokens dentro de um bloco são geralmente preditos independentemente, sem considerar dependências causais entre eles.
O Problema com Métodos Existentes
Outros métodos recentes, como Domino e DSpark, tentaram adicionar causalidade ao rascunho de blocos paralelos—levar em conta as dependências entre tokens em um bloco. Mas isto requer treinar o rascunho do zero, o que é caro e requer enormes recursos computacionais. Organizações sem petabytes de dados e clusters GPU massivos não podem permitir tal retreinamento.
O Que Há de Novo no DeLS-Spec
DeLS-Spec resolve este problema através da divisão de papéis entre dois especialistas. O método usa o modelo DFlash existente como um "especialista de contexto longo" e adiciona uma cabeça local leve como um "especialista de contexto curto".
A vantagem fundamental: a cabeça local pode ser treinada completamente de forma independente, sem treinamento conjunto com o modelo principal ou a espinha dorsal de DFlash. Isto reduz drasticamente os custos computacionais. A cabeça local é uma pequena rede que olha apenas para contextos recentes e aprende a prever tokens levando em conta dependências causais.
- Método aplicado aos modelos Qwen3
- Treinamento requer custos mínimos—apenas um adaptador leve é treinado
- Na inferência, logits de dois especialistas são combinados
- Cabeça local é independente de qualquer versão específica de ponto de verificação de DFlash
- Melhoria tanto em velocidade de execução quanto em comprimento de tokens aceitos em benchmarks
Resultados de Testes
Em benchmarks Qwen3, DeLS-Spec mostrou melhoria tanto em velocidade de execução (speedup) quanto em comprimento médio de tokens aceitos (average acceptance length) em comparação com DFlash. Isto é verdadeiro para três categorias de tarefas: matemática, programação e sistemas de diálogo.
Por que isto importa: sequências mais longas de tokens aceitos significam que o rascunho prevê mais precisamente e o sistema pode gerar mais texto em uma única iteração, o que afeta diretamente a taxa de transferência.
Por Que Isto Importa para a Indústria
Acelerar a inferência de LLM não é apenas uma questão de velocidade, mas de economia. É mais barato treinar um pequeno adaptador do que retreinar um rascunho inteiro ou um modelo base. Isto torna os métodos de otimização mais acessíveis para organizações que não têm recursos para retreinamento em larga escala.
Com LLMs se tornando cada vez mais complexos e intensivos em energia, tais melhorias incrementais em eficiência de inferência se acumulam e se transformam em ganhos significativos em velocidade e custo. DeLS-Spec demonstra uma tendência importante: melhores resultados frequentemente são alcançados não através do retreinamento de grandes modelos, mas através de combinação elegante de componentes existentes.
O Que Isto Significa
Esta abordagem abre caminhos para otimização de LLM mais acessível em organizações de todos os tamanhos, permitindo até pequenos times alcançarem aceleração sem orçamentos computacionais maciços.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.