Tencent открыл AngelSpec: фреймворк для ускорения инференса LLM через speculative decoding
Tencent открыл AngelSpec — torch-native фреймворк для обучения draft-моделей, ускоряющих инференс больших языковых моделей через speculative decoding. Вместо одной универсальной модели он обучает две: MTP для диалогов и block-parallel для кода и математики. На тесте средний уровень принятия черновых токенов вырос с 52,8% до 66,4%, а качество ответов не меняется — метод lossless.
Processado por IA de MarkTechPost; editado por Hamidun News
A Tencent abriu o código-fonte do AngelSpec em 30 de julho de 2026 — um framework torch-native para treinar modelos rascunho (draft) de speculative decoding que, nos modelos Hy3, elevou a taxa média de aceitação dos tokens propostos de 52,8% para 66,4% sem perda de qualidade na geração.
O que é speculative decoding
Speculative decoding é uma forma de acelerar a geração de um modelo de linguagem grande sem perder qualidade na resposta. Um modelo rascunho leve propõe vários tokens futuros de uma vez, e o modelo principal (target) verifica todos eles em uma única passagem via rejection sampling. O método é lossless: o texto final coincide com o que o modelo principal geraria sozinho. O ganho de velocidade depende de duas coisas — quantos tokens rascunho são aceitos e quanto tempo dura o ciclo completo de "rascunho — verificação".
- Data de lançamento: 30 de julho de 2026, licença open source
- Framework torch-native, funciona em modelos da família Hy3
- Cobre duas abordagens: MTP autorregressivo e a família block-parallel DFlash (DFly, D-cut)
- Taxa média de aceitação de tokens: 52,8% → 66,4% com T=0
- Comprimento médio do rascunho aceito: 2,58 → 2,99 tokens
Por que um único modelo universal perde
Um único modelo rascunho universal perde porque o tráfego real é heterogêneo, e duas métricas de velocidade puxam em direções opostas. Em um diálogo aberto com alta entropia, dezenas de continuações são válidas, então a aceitação cai rapidamente com a profundidade da proposta — gerar um bloco longo não compensa. Código e matemática se comportam de outra forma: sintaxe, identificadores repetidos e derivações passo a passo restringem muito mais os tokens futuros e criam trechos longos e previsíveis. Por isso o AngelSpec entrega dois modelos rascunho em vez de um único compromisso: o MTP é treinado com dados de diálogo diversos, enquanto o block-diffusion é reforçado com exemplos de código e matemática.
«O
AngelSpec trata a heterogeneidade da carga de trabalho como uma restrição de projeto de primeira classe», afirma a análise da MarkTechPost.
Como funciona o caminho MTP
O caminho MTP resolve o desalinhamento entre treinamento e inferência por meio de um esquema com parâmetros compartilhados e múltiplas profundidades. O modelo original Hy3 foi treinado com uma única camada MTP sem desenrolamento recorrente, por isso, na segunda e na terceira posição do rascunho, os tokens eram aceitos visivelmente pior. O AngelSpec mantém D profundidades lógicas, mas reutiliza um único bloco MTP físico, desenrolando-o em D etapas durante o treinamento. Seguindo o princípio Training-Time Test do EAGLE-3, a profundidade k+1 recebe não o token de referência, mas a previsão argmax da profundidade k. Além disso, o backbone principal e a cabeça de linguagem ficam congelados, e o treinamento roda sobre execuções do próprio modelo target.
O efeito se concentra exatamente onde é necessário. Segundo dados da Tencent, no benchmark GSM8K a aceitação na terceira posição subiu de 0,290 para 0,706, e no HumanEval — de 0,387 para 0,757, enquanto a primeira posição quase não mudou (0,799 → 0,814).
O que isso significa
O AngelSpec mostra que é mais vantajoso construir a aceleração da inferência não em torno de um benchmark médio, mas em torno da heterogeneidade real da carga — com diferentes modelos rascunho para diálogos e para código. Para equipes que operam LLMs em produção, esta é uma ferramenta aberta para extrair mais velocidade do mesmo hardware sem perda de qualidade.
Perguntas frequentes
O que é speculative decoding em termos simples?
É um método para acelerar LLMs em que um modelo pequeno adivinha vários tokens seguintes com antecedência, e um modelo grande os verifica em uma única passagem. Se o palpite estiver correto, a geração fica mais rápida; a qualidade do texto não muda.
Em que o
AngelSpec se diferencia de um único modelo rascunho?
O AngelSpec treina dois modelos especializados: MTP para diálogos de alta entropia e block-parallel para código e matemática com trechos longos e previsíveis. Segundo as medições da Tencent, isso elevou a taxa média de aceitação de tokens de 52,8% para 66,4%.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.