MarkTechPost→ original

Tencent открыл AngelSpec: фреймворк для ускорения инференса LLM через speculative decoding

Tencent открыл AngelSpec — torch-native фреймворк для обучения draft-моделей, ускоряющих инференс больших языковых моделей через speculative decoding. Вместо одной универсальной модели он обучает две: MTP для диалогов и block-parallel для кода и математики. На тесте средний уровень принятия черновых токенов вырос с 52,8% до 66,4%, а качество ответов не меняется — метод lossless.

Processado por IA de MarkTechPost; editado por Hamidun News
Tencent открыл AngelSpec: фреймворк для ускорения инференса LLM через speculative decoding
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

A Tencent abriu o código-fonte do AngelSpec em 30 de julho de 2026 — um framework torch-native para treinar modelos rascunho (draft) de speculative decoding que, nos modelos Hy3, elevou a taxa média de aceitação dos tokens propostos de 52,8% para 66,4% sem perda de qualidade na geração.

O que é speculative decoding

Speculative decoding é uma forma de acelerar a geração de um modelo de linguagem grande sem perder qualidade na resposta. Um modelo rascunho leve propõe vários tokens futuros de uma vez, e o modelo principal (target) verifica todos eles em uma única passagem via rejection sampling. O método é lossless: o texto final coincide com o que o modelo principal geraria sozinho. O ganho de velocidade depende de duas coisas — quantos tokens rascunho são aceitos e quanto tempo dura o ciclo completo de "rascunho — verificação".

  • Data de lançamento: 30 de julho de 2026, licença open source
  • Framework torch-native, funciona em modelos da família Hy3
  • Cobre duas abordagens: MTP autorregressivo e a família block-parallel DFlash (DFly, D-cut)
  • Taxa média de aceitação de tokens: 52,8% → 66,4% com T=0
  • Comprimento médio do rascunho aceito: 2,58 → 2,99 tokens

Por que um único modelo universal perde

Um único modelo rascunho universal perde porque o tráfego real é heterogêneo, e duas métricas de velocidade puxam em direções opostas. Em um diálogo aberto com alta entropia, dezenas de continuações são válidas, então a aceitação cai rapidamente com a profundidade da proposta — gerar um bloco longo não compensa. Código e matemática se comportam de outra forma: sintaxe, identificadores repetidos e derivações passo a passo restringem muito mais os tokens futuros e criam trechos longos e previsíveis. Por isso o AngelSpec entrega dois modelos rascunho em vez de um único compromisso: o MTP é treinado com dados de diálogo diversos, enquanto o block-diffusion é reforçado com exemplos de código e matemática.

«O

AngelSpec trata a heterogeneidade da carga de trabalho como uma restrição de projeto de primeira classe», afirma a análise da MarkTechPost.

Como funciona o caminho MTP

O caminho MTP resolve o desalinhamento entre treinamento e inferência por meio de um esquema com parâmetros compartilhados e múltiplas profundidades. O modelo original Hy3 foi treinado com uma única camada MTP sem desenrolamento recorrente, por isso, na segunda e na terceira posição do rascunho, os tokens eram aceitos visivelmente pior. O AngelSpec mantém D profundidades lógicas, mas reutiliza um único bloco MTP físico, desenrolando-o em D etapas durante o treinamento. Seguindo o princípio Training-Time Test do EAGLE-3, a profundidade k+1 recebe não o token de referência, mas a previsão argmax da profundidade k. Além disso, o backbone principal e a cabeça de linguagem ficam congelados, e o treinamento roda sobre execuções do próprio modelo target.

O efeito se concentra exatamente onde é necessário. Segundo dados da Tencent, no benchmark GSM8K a aceitação na terceira posição subiu de 0,290 para 0,706, e no HumanEval — de 0,387 para 0,757, enquanto a primeira posição quase não mudou (0,799 → 0,814).

O que isso significa

O AngelSpec mostra que é mais vantajoso construir a aceleração da inferência não em torno de um benchmark médio, mas em torno da heterogeneidade real da carga — com diferentes modelos rascunho para diálogos e para código. Para equipes que operam LLMs em produção, esta é uma ferramenta aberta para extrair mais velocidade do mesmo hardware sem perda de qualidade.

Perguntas frequentes

O que é speculative decoding em termos simples?

É um método para acelerar LLMs em que um modelo pequeno adivinha vários tokens seguintes com antecedência, e um modelo grande os verifica em uma única passagem. Se o palpite estiver correto, a geração fica mais rápida; a qualidade do texto não muda.

Em que o

AngelSpec se diferencia de um único modelo rascunho?

O AngelSpec treina dois modelos especializados: MTP para diálogos de alta entropia e block-parallel para código e matemática com trechos longos e previsíveis. Segundo as medições da Tencent, isso elevou a taxa média de aceitação de tokens de 52,8% para 66,4%.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…