Modelos

Diffusion Model

Um diffusion model é um sistema de IA generativa que produz imagens, áudio ou vídeo ao aprender a reverter um processo iterativo de adição de ruído, começando de ruído aleatório e progressivamente removendo o ruído através de etapas aprendidas para produzir um output coerente.

Um diffusion model é uma classe de modelo generativo que aprende a distribuição de dados reais—mais comumente imagens—ao treinar para desfazer um processo estocástico que gradualmente corrompe dados limpos em ruído puro. A abordagem é fundamentada em termodinâmica estatística de não-equilíbrio e foi formalizada para deep learning no artigo Denoising Diffusion Probabilistic Models (DDPM) de Ho et al. em 2020. Diffusion models agora fundamentam a maioria dos sistemas líderes de geração de imagem: Stable Diffusion da Stability AI, DALL-E 3 da OpenAI, Imagen e Imagen 3 do Google e Firefly da Adobe todos confiam em diffusion ou modelagem generativa baseada em score fortemente relacionada.

O treinamento envolve dois processos. O processo forward toma uma amostra de dados limpos e adiciona pequenas quantidades de ruído Gaussiano sobre T etapas (frequentemente 1.000 ou mais), produzindo uma sequência de imagem original a ruído puro; este processo é fixo e não requer parâmetros aprendidos. O processo reverse é o que a rede neural aprende: dados uma amostra ruidosa na etapa t e o nível de ruído, prever o ruído que foi adicionado, permitindo que seja subtraído. Na inferência, o modelo inicia a partir de ruído Gaussiano aleatório e aplica iterativamente esta etapa de denoising para produzir uma amostra da distribuição de dados aprendida. Geração condicionada por texto é alcançada via cross-attention a embeddings de texto (de CLIP ou T5), e classifier-free guidance amplifica aderência ao prompt de texto ao custo da diversidade. Métodos de amostragem acelerados—DDIM, DPM-Solver e flow matching—reduziram os passos de denoising exigidos de milhares para dezenas, ou até um único passo com consistency distillation.

Diffusion models em grande parte suplantaram generative adversarial networks (GANs) como o paradigma dominante de geração de imagem após 2022. GANs requerem um delicado balanço de treinamento adversarial entre gerador e discriminador, sofrem de mode collapse e são difíceis de escalar. Diffusion models treinam com um objetivo simples de denoising, são estáveis para otimizar, produzem amostras diversas de alta qualidade e escalam previsibilidade com tamanho de modelo e dados. O lançamento público do Stable Diffusion 1.x em agosto de 2022, que permitiu executar geração de imagem em GPUs de consumidor, desencadeou adoção rápida e uma explosão de produtos e pesquisa downstream.

A partir de 2026, diffusion e modelos de flow-matching fortemente relacionados permanecem o backbone de geração de imagem e vídeo comercial. Flow matching—usado em Stable Diffusion 3, modelos FLUX de Black Forest Labs e vários geradores de vídeo—oferece um objetivo de treinamento matematicamente mais limpo e inferência mais rápida do que DDPM, e é cada vez mais preferido em sistemas novos. Modelos de video diffusion, incluindo Sora da OpenAI (anunciado em fevereiro de 2024) e Veo do Google, estendem a arquitetura para coerência temporal entre frames. Além de visuais, abordagens baseadas em diffusion são aplicadas a síntese de fala (AudioLM do Google, Voicebox do Meta) e design molecular, onde modelos como aqueles de Schrödinger e Insilico Medicine geram moléculas de drogas candidatas ao denoising em espaço de coordenadas 3-D.

Exemplo

Um designer gráfico digita um prompt de texto no Adobe Firefly; o diffusion model inicia a partir de ruído aleatório e aplica várias centenas de passos de denoising guiados pelo text embedding do prompt, produzindo uma imagem fotorrealista em poucos segundos.

Termos relacionados

← Glossário