Speculative Decoding
Speculative decoding é uma técnica de inferência que usa um modelo draft pequeno para propor múltiplos tokens em paralelo, então os verifica com o modelo alvo grande em um único passe forward, reduzindo a latência por 2–4× sem alterar a qualidade da saída.
Speculative decoding é um método para acelerar a inferência de modelo de linguagem autorregressiva. Na geração padrão, um modelo grande produz um token por vez através de passagens forward sequenciais, cada uma computacionalmente cara. Speculative decoding quebra esse gargalo intercalando um modelo draft rápido com o modelo alvo para explorar o fato de que atenção transformer sobre uma sequência de comprimento fixo pode ser computada em um único passe paralelo.
O mecanismo funciona em dois estágios. Um modelo draft leve — por exemplo, um modelo de 7B atuando como draft para um alvo 70B — gera K tokens candidatos em K passagens sequenciais baratas. O modelo alvo grande então avalia todas as K+1 posições simultaneamente em um passe forward, verificando cada token proposto contra sua própria distribuição. Tokens aceitos são mantidos; no primeiro token rejeitado, o processo volta e substitui a correção do modelo alvo. Crucialmente, a distribuição de tokens aceitos é provadamente idêntica ao que o modelo grande teria gerado por conta própria, de modo que a qualidade da saída seja matematicamente inalterada.
A técnica importa porque reduz a latência ponta-a-ponta em aproximadamente 2–4× no hardware típico sem trade-off de acurácia. Isso é especialmente valioso para aplicações interativas onde a velocidade de streaming e o tempo até o primeiro token afetam diretamente a experiência do usuário. O speedup depende da taxa de aceitação do draft: um draft bem combinado que concorda com o alvo na maioria dos tokens produz os maiores ganhos, e o benefício diminui quando os dois modelos divergem significativamente em estilo ou domínio.
Até 2025–2026, speculative decoding é implantado em produção pelo Google para inferência Gemini, Anthropic para Claude, e principais provedores de inferência incluindo Together AI e Groq. Variantes como Medusa (múltiplas cabeças draft paralelas anexadas a um único modelo), EAGLE (uma cabeça especulativa treinada usando entradas em nível de features do alvo), e speculative decoding autossuficiente (usando camadas transformer anteriores como o draft) estenderam a aplicabilidade da técnica e reduziram a necessidade de um modelo draft separadamente treinado.