arXiv cs.CL→ original

MultiMDM: диффузионная языковая модель для генерации текста за несколько шагов

Исследователи представили MultiMDM — диффузионную языковую модель с несколькими масками. В отличие от обычных masked diffusion моделей, где все траектории схлопываются в одно замаскированное состояние, MultiMDM сохраняет структуру маскирования и генерирует текст за небольшое число шагов. Модель можно дообучать поверх уже готовых MDM, а не тренировать с нуля.

Processado por IA de arXiv cs.CL; editado por Hamidun News
MultiMDM: диффузионная языковая модель для генерации текста за несколько шагов
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisadores apresentaram o MultiMDM (multi-mask diffusion model) — um modelo de linguagem de difusão que usa várias máscaras em vez de uma única e, graças a isso, gera texto em um número pequeno de passos sem perda de qualidade. O preprint foi publicado no arXiv, na seção cs.CL, em julho de 2026.

Por que a geração few-step emperra

Os modelos de difusão mascarada comuns (MDM) funcionam mal no regime few-step, porque todas as suas trajetórias diretas colapsam em um único estado totalmente mascarado. Nesse ponto não sobra "entropia residual" para as abordagens de consistência se apoiarem na geração em poucos passos — o modelo simplesmente não tem em que se agarrar.

A alternativa na forma de uniform-state diffusion evita essa degeneração, mas paga outro preço: ali é mais difícil distinguir tokens limpos do ruído. Segundo o arXiv, isso costuma prejudicar tanto a qualidade da geração quanto a eficiência do treinamento. O MultiMDM resolve os dois problemas de uma vez, permanecendo dentro do paradigma "mascarado".

A velocidade aqui não é cosmética: quanto menos passos, mais barata e rápida a inferência, por isso o regime few-step é a chave para a praticidade dos LLMs de difusão.

O que o MultiMDM propõe

O MultiMDM preserva a estrutura de mascaramento, mas introduz um conjunto de várias máscaras em vez de uma única. No processo direto (forward), cada token limpo primeiro é empurrado para sua máscara designada e, depois, gradualmente misturado por todo o conjunto de máscaras.

Por causa disso, o processo inverso (backward) ganha a capacidade de "rascunho" (drafting): o modelo primeiro prevê a máscara designada e só depois a refina até o token limpo. É justamente esse movimento em dois estágios que permite se virar com um número pequeno de passos.

Ao contrário da máscara única dos MDM clássicos, o conjunto de máscaras deixa ao modelo "espaço de manobra" — exatamente a entropia residual que faltava para o regime few-step.

  • Modelo — MultiMDM (multi-mask diffusion model), preprint no arXiv (cs.CL), julho de 2026
  • Ideia-chave — várias máscaras em vez de uma, para preservar a estrutura de mascaramento na geração few-step
  • O processo backward funciona em dois tempos: primeiro o rascunho (previsão da máscara), depois o refinamento até o token limpo
  • Treinamento — ELBO em forma fechada (closed-form), que permite continual training sobre MDMs já pré-treinados
  • Destilação — consistency distillation puramente discrete-state com shared-Gumbel coupling

Como isso é treinado

Os autores derivaram um ELBO em forma fechada (closed-form) — um objetivo de treinamento em forma fechada que permite não treinar o MultiMDM do zero, mas sim continuar seu treinamento sobre MDMs já pré-treinados. Isso reduz sensivelmente o custo de entrada: os modelos existentes se tornam o ponto de partida.

O segundo componente é uma consistency distillation puramente discrete-state com um acoplamento shared-Gumbel coupling, que reduz a entropia pathwise. A destilação é necessária justamente para "comprimir" a geração de muitos passos em poucos passos, preservando a qualidade.

"O

MultiMDM oferece uma base eficiente para a geração few-step baseada em princípios", afirma o resumo do artigo no arXiv.

O que isso significa

Os modelos de linguagem de difusão são a principal alternativa aos modelos autorregressivos habituais, que escrevem o texto estritamente token a token. A difusão é capaz de gerar de uma vez todo o trecho e refiná-lo em várias passagens, e o MultiMDM é um passo para fazer isso rápido e sem queda de qualidade, apoiando-se em modelos já treinados.

Perguntas frequentes

Em que o

MultiMDM difere dos modelos de difusão mascarada comuns?

O MultiMDM usa não uma única máscara, mas um conjunto inteiro. Isso preserva a estrutura "mascarada" e dá ao processo inverso a capacidade de rascunho — primeiro prever a máscara, depois refinar o token —, algo que os MDMs clássicos não têm, com seu único estado totalmente mascarado.

É preciso treinar o MultiMDM do zero?

Não. Segundo o arXiv, o ELBO em forma fechada permite realizar continual training sobre MDMs já pré-treinados, ou seja, usar os modelos existentes como ponto de partida em vez de treinar um novo modelo do zero absoluto.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…