Inferência

Speculative Decoding

Speculative decoding é uma técnica de inferência que usa um modelo draft pequeno para propor múltiplos tokens em paralelo, então os verifica com o modelo alvo grande em um único passe forward, reduzindo a latência por 2–4× sem alterar a qualidade da saída.

Speculative decoding é um método para acelerar a inferência de modelo de linguagem autorregressiva. Na geração padrão, um modelo grande produz um token por vez através de passagens forward sequenciais, cada uma computacionalmente cara. Speculative decoding quebra esse gargalo intercalando um modelo draft rápido com o modelo alvo para explorar o fato de que atenção transformer sobre uma sequência de comprimento fixo pode ser computada em um único passe paralelo.

O mecanismo funciona em dois estágios. Um modelo draft leve — por exemplo, um modelo de 7B atuando como draft para um alvo 70B — gera K tokens candidatos em K passagens sequenciais baratas. O modelo alvo grande então avalia todas as K+1 posições simultaneamente em um passe forward, verificando cada token proposto contra sua própria distribuição. Tokens aceitos são mantidos; no primeiro token rejeitado, o processo volta e substitui a correção do modelo alvo. Crucialmente, a distribuição de tokens aceitos é provadamente idêntica ao que o modelo grande teria gerado por conta própria, de modo que a qualidade da saída seja matematicamente inalterada.

A técnica importa porque reduz a latência ponta-a-ponta em aproximadamente 2–4× no hardware típico sem trade-off de acurácia. Isso é especialmente valioso para aplicações interativas onde a velocidade de streaming e o tempo até o primeiro token afetam diretamente a experiência do usuário. O speedup depende da taxa de aceitação do draft: um draft bem combinado que concorda com o alvo na maioria dos tokens produz os maiores ganhos, e o benefício diminui quando os dois modelos divergem significativamente em estilo ou domínio.

Até 2025–2026, speculative decoding é implantado em produção pelo Google para inferência Gemini, Anthropic para Claude, e principais provedores de inferência incluindo Together AI e Groq. Variantes como Medusa (múltiplas cabeças draft paralelas anexadas a um único modelo), EAGLE (uma cabeça especulativa treinada usando entradas em nível de features do alvo), e speculative decoding autossuficiente (usando camadas transformer anteriores como o draft) estenderam a aplicabilidade da técnica e reduziram a necessidade de um modelo draft separadamente treinado.

Exemplo

Uma API de produção servindo um modelo de 70B-parâmetros co-localiza um modelo draft de 7B; com uma taxa de aceitação de token de 75%, a latência de streaming cai de aproximadamente 120 ms para menos de 45 ms por token decodificado sem qualquer mudança nas saídas do modelo.

Termos relacionados

Últimas notícias sobre o tema

← Glossário