Apple ML Research→ original

Apple ML Research: como modelos de difusão aprendem a selecionar tokens sem heurísticas manuais

Os modelos de linguagem por difusão (dLLMs) alcançaram os modelos do tipo GPT em qualidade, mas permanece um problema central: como selecionar qual token revelar em cada etapa. A Apple ML Research propõe substituir heurísticas manuais como confidence thresholding por políticas aprendidas, para que o modelo aprenda estratégias ideais por conta própria, sem ajuste manual de parâmetros para cada tarefa.

Processado por IA de Apple ML Research; editado por Hamidun News
Apple ML Research: como modelos de difusão aprendem a selecionar tokens sem heurísticas manuais
Fonte: Apple ML Research. Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisa do Apple ML: Como Modelos de Difusão Aprendem a Selecionar Tokens Sem Heurísticas Manuais

Apple ML Research publicou em julho de 2026 um estudo sobre treinamento de políticas de revelação de tokens para modelos de linguagem por difusão: em vez de heurísticas manuais que exigem ajuste e mostram resultados instáveis, propõe-se treinar o próprio processo de seleção de tokens.

O Que São Modelos de Linguagem por Difusão?

Modelos de linguagem por difusão (dLLMs) diferem fundamentalmente das arquiteturas autorregressivas familiares como GPT ou Claude. Um modelo autorregressivo constrói texto sequencialmente — token por token da esquerda para a direita. Um modelo de difusão funciona diferentemente: começa com texto completamente "mascarado" e, ao longo de vários passos, gradualmente "revela" posições. Segundo Apple ML Research, dLLMs modernos em muitas tarefas práticas já são comparáveis em qualidade com modelos autorregressivos — promovendo vantagens em velocidade de inferência. Como o modelo pode revelar múltiplos tokens em uma única etapa, teoricamente é possível obter maior vazão com custos computacionais menores.

Por Que a Seleção de Tokens Decide Tudo

Em cada etapa de difusão, o modelo deve responder a pergunta: qual dos tokens mascarados restantes deve ser revelado a seguir? Essa pergunta aparentemente técnica afeta diretamente tanto a qualidade do texto gerado quanto a velocidade da operação. Uma abordagem ingênua — seleção aleatória de tokens — é a pior estratégia. Pesquisadores da Apple descobriram que a heurística confidence thresholding produz resultados significativamente melhores: o modelo prioriza abrir posições onde sua confiança (pontuação de probabilidade) é mais alta.

Fatos-chave sobre heurísticas atuais:

  • Confidence thresholding melhora a qualidade da amostra em comparação com revelação aleatória
  • A estratégia aumenta a vazão de tokens — o número de tokens por unidade de tempo
  • A desvantagem é a necessidade de ajuste manual de parâmetros para cada tarefa
  • O desempenho da heurística é instável e varia dependendo da aplicação

O Que Apple Propõe em Vez de Regras Manuais

A ideia central do trabalho é substituir heurísticas fixas por uma política de revelação aprendível. Em vez de um desenvolvedor selecionar manualmente valores de limite e ajustar parâmetros para cada cenário, o próprio modelo aprende a estratégia ótima de seleção de tokens.

"Tais heurísticas têm desvantagens: elas exigem ajuste manual, e seu desempenho..." — da anotação do estudo de

Apple ML Research.

O princípio não é novo em aprendizado de máquina: substituir heurísticas humanas por estratégias automaticamente otimizadas é o caminho padrão de "ajuste manual" para "aprendizagem de dados". Aplicado a modelos de difusão, tal abordagem potencialmente descobre estratégias de revelação de tokens que um desenvolvedor humano não teria pensado antecipadamente, e não requer recalibração ao mudar para novas tarefas.

O Que Isso Significa

Modelos de linguagem por difusão atraem atenção como uma das abordagens alternativas promissoras para arquitetura de modelos de linguagem grande — especialmente do ponto de vista de eficiência de inferência. Se as políticas de revelação de tokens puderem ser treinadas automaticamente e consistentemente superarem heurísticas manuais, isso eliminará a barreira prática chave para aplicar dLLMs em condições industriais, onde custo e velocidade de geração são críticos.

Perguntas Frequentes

Como Modelos de Linguagem por Difusão Diferem de GPT?

Modelos autorregressivos como GPT geram texto sequencialmente — um token por vez. Modelos de linguagem por difusão começam com texto completamente mascarado e iterativamente o "revelam" em vários passos, permitindo processamento paralelo de múltiplas posições e potencialmente acelerando a inferência.

O Que É Confidence Thresholding no Contexto de dLLMs?

Esta é uma heurística onde em cada passo de difusão, o modelo primeiro abre a posição onde sua confiança é mais alta. Apple ML Research mostra que isso melhora tanto a qualidade do texto quanto a velocidade de geração em comparação com revelação aleatória — mas exige ajuste manual de parâmetros.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…