arXiv cs.CL→ original

DeLS-Spec acelerou a inferência de LLM sem retreinar modelos

O novo método DeLS-Spec acelera a geração de texto de modelos de linguagem grande. Sua característica principal: um adaptador leve treinado independentemente do modelo, sem retreinamento de modelo. Testes em modelos Qwen3 mostraram melhorias de velocidade para tarefas de matemática, código e diálogo.

Processado por IA de arXiv cs.CL; editado por Hamidun News
DeLS-Spec acelerou a inferência de LLM sem retreinar modelos
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisadores propuseram DeLS-Spec—um novo método para acelerar a geração de texto em modelos de linguagem. A abordagem permite pela primeira vez alcançar aceleração significativa sem a necessidade de retreinar os modelos mesmos, o que reduz substancialmente as barreiras para adotar tais otimizações.

Como Funciona a Decodificação Especulativa

Decodificação especulativa é uma técnica que acelera a inferência de LLM gerando múltiplos tokens em paralelo em vez de um por vez. Um pequeno modelo de rascunho prevê tokens candidatos e o modelo principal verifica sua correção em uma única passagem. Se a previsão correspondeu—tokens são aceitos; se não, o processo se repete.

Métodos mais avançados, como DFlash, geram um bloco inteiro de tokens em uma única passagem, acelerando ainda mais o processo. Mas isto cria um problema: tokens dentro de um bloco são geralmente preditos independentemente, sem considerar dependências causais entre eles.

O Problema com Métodos Existentes

Outros métodos recentes, como Domino e DSpark, tentaram adicionar causalidade ao rascunho de blocos paralelos—levar em conta as dependências entre tokens em um bloco. Mas isto requer treinar o rascunho do zero, o que é caro e requer enormes recursos computacionais. Organizações sem petabytes de dados e clusters GPU massivos não podem permitir tal retreinamento.

O Que Há de Novo no DeLS-Spec

DeLS-Spec resolve este problema através da divisão de papéis entre dois especialistas. O método usa o modelo DFlash existente como um "especialista de contexto longo" e adiciona uma cabeça local leve como um "especialista de contexto curto".

A vantagem fundamental: a cabeça local pode ser treinada completamente de forma independente, sem treinamento conjunto com o modelo principal ou a espinha dorsal de DFlash. Isto reduz drasticamente os custos computacionais. A cabeça local é uma pequena rede que olha apenas para contextos recentes e aprende a prever tokens levando em conta dependências causais.

  • Método aplicado aos modelos Qwen3
  • Treinamento requer custos mínimos—apenas um adaptador leve é treinado
  • Na inferência, logits de dois especialistas são combinados
  • Cabeça local é independente de qualquer versão específica de ponto de verificação de DFlash
  • Melhoria tanto em velocidade de execução quanto em comprimento de tokens aceitos em benchmarks

Resultados de Testes

Em benchmarks Qwen3, DeLS-Spec mostrou melhoria tanto em velocidade de execução (speedup) quanto em comprimento médio de tokens aceitos (average acceptance length) em comparação com DFlash. Isto é verdadeiro para três categorias de tarefas: matemática, programação e sistemas de diálogo.

Por que isto importa: sequências mais longas de tokens aceitos significam que o rascunho prevê mais precisamente e o sistema pode gerar mais texto em uma única iteração, o que afeta diretamente a taxa de transferência.

Por Que Isto Importa para a Indústria

Acelerar a inferência de LLM não é apenas uma questão de velocidade, mas de economia. É mais barato treinar um pequeno adaptador do que retreinar um rascunho inteiro ou um modelo base. Isto torna os métodos de otimização mais acessíveis para organizações que não têm recursos para retreinamento em larga escala.

Com LLMs se tornando cada vez mais complexos e intensivos em energia, tais melhorias incrementais em eficiência de inferência se acumulam e se transformam em ganhos significativos em velocidade e custo. DeLS-Spec demonstra uma tendência importante: melhores resultados frequentemente são alcançados não através do retreinamento de grandes modelos, mas através de combinação elegante de componentes existentes.

O Que Isto Significa

Esta abordagem abre caminhos para otimização de LLM mais acessível em organizações de todos os tamanhos, permitindo até pequenos times alcançarem aceleração sem orçamentos computacionais maciços.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…