Apple ML Research: como modelos de difusão aprendem a selecionar tokens sem heurísticas manuais
Os modelos de linguagem por difusão (dLLMs) alcançaram os modelos do tipo GPT em qualidade, mas permanece um problema central: como selecionar qual token revelar em cada etapa. A Apple ML Research propõe substituir heurísticas manuais como confidence thresholding por políticas aprendidas, para que o modelo aprenda estratégias ideais por conta própria, sem ajuste manual de parâmetros para cada tarefa.
Processado por IA de Apple ML Research; editado por Hamidun News
Pesquisa do Apple ML: Como Modelos de Difusão Aprendem a Selecionar Tokens Sem Heurísticas Manuais
Apple ML Research publicou em julho de 2026 um estudo sobre treinamento de políticas de revelação de tokens para modelos de linguagem por difusão: em vez de heurísticas manuais que exigem ajuste e mostram resultados instáveis, propõe-se treinar o próprio processo de seleção de tokens.
O Que São Modelos de Linguagem por Difusão?
Modelos de linguagem por difusão (dLLMs) diferem fundamentalmente das arquiteturas autorregressivas familiares como GPT ou Claude. Um modelo autorregressivo constrói texto sequencialmente — token por token da esquerda para a direita. Um modelo de difusão funciona diferentemente: começa com texto completamente "mascarado" e, ao longo de vários passos, gradualmente "revela" posições. Segundo Apple ML Research, dLLMs modernos em muitas tarefas práticas já são comparáveis em qualidade com modelos autorregressivos — promovendo vantagens em velocidade de inferência. Como o modelo pode revelar múltiplos tokens em uma única etapa, teoricamente é possível obter maior vazão com custos computacionais menores.
Por Que a Seleção de Tokens Decide Tudo
Em cada etapa de difusão, o modelo deve responder a pergunta: qual dos tokens mascarados restantes deve ser revelado a seguir? Essa pergunta aparentemente técnica afeta diretamente tanto a qualidade do texto gerado quanto a velocidade da operação. Uma abordagem ingênua — seleção aleatória de tokens — é a pior estratégia. Pesquisadores da Apple descobriram que a heurística confidence thresholding produz resultados significativamente melhores: o modelo prioriza abrir posições onde sua confiança (pontuação de probabilidade) é mais alta.
Fatos-chave sobre heurísticas atuais:
- Confidence thresholding melhora a qualidade da amostra em comparação com revelação aleatória
- A estratégia aumenta a vazão de tokens — o número de tokens por unidade de tempo
- A desvantagem é a necessidade de ajuste manual de parâmetros para cada tarefa
- O desempenho da heurística é instável e varia dependendo da aplicação
O Que Apple Propõe em Vez de Regras Manuais
A ideia central do trabalho é substituir heurísticas fixas por uma política de revelação aprendível. Em vez de um desenvolvedor selecionar manualmente valores de limite e ajustar parâmetros para cada cenário, o próprio modelo aprende a estratégia ótima de seleção de tokens.
"Tais heurísticas têm desvantagens: elas exigem ajuste manual, e seu desempenho..." — da anotação do estudo de
Apple ML Research.
O princípio não é novo em aprendizado de máquina: substituir heurísticas humanas por estratégias automaticamente otimizadas é o caminho padrão de "ajuste manual" para "aprendizagem de dados". Aplicado a modelos de difusão, tal abordagem potencialmente descobre estratégias de revelação de tokens que um desenvolvedor humano não teria pensado antecipadamente, e não requer recalibração ao mudar para novas tarefas.
O Que Isso Significa
Modelos de linguagem por difusão atraem atenção como uma das abordagens alternativas promissoras para arquitetura de modelos de linguagem grande — especialmente do ponto de vista de eficiência de inferência. Se as políticas de revelação de tokens puderem ser treinadas automaticamente e consistentemente superarem heurísticas manuais, isso eliminará a barreira prática chave para aplicar dLLMs em condições industriais, onde custo e velocidade de geração são críticos.
Perguntas Frequentes
Como Modelos de Linguagem por Difusão Diferem de GPT?
Modelos autorregressivos como GPT geram texto sequencialmente — um token por vez. Modelos de linguagem por difusão começam com texto completamente mascarado e iterativamente o "revelam" em vários passos, permitindo processamento paralelo de múltiplas posições e potencialmente acelerando a inferência.
O Que É Confidence Thresholding no Contexto de dLLMs?
Esta é uma heurística onde em cada passo de difusão, o modelo primeiro abre a posição onde sua confiança é mais alta. Apple ML Research mostra que isso melhora tanto a qualidade do texto quanto a velocidade de geração em comparação com revelação aleatória — mas exige ajuste manual de parâmetros.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.