Jiqizhixin (机器之心)→ original

Генеративные модели теперь можно обучать сквозным способом: секрет — цикл for

В 2012 году AlexNet доказал: сквозное обучение бьёт любой ручной пайплайн. Теперь этот принцип применяют к генеративным моделям — диффузионным и авторегрессионным. Ключ оказался простым: обычный цикл for позволяет передать градиент через весь итеративный процесс генерации целиком. Не нужны новые архитектуры — стандартный backprop через цикл делает всё сам.

Processado por IA de Jiqizhixin (机器之心); editado por Hamidun News
Генеративные модели теперь можно обучать сквозным способом: секрет — цикл for
Fonte: Jiqizhixin (机器之心). Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisadores, cujo trabalho é analisado pela Jiqizhixin, mostram que modelos generativos podem ser treinados de ponta a ponta (end-to-end) — com o mesmo princípio que revolucionou a visão computacional em 2012. O mecanismo-chave se mostrou surpreendentemente simples — um laço `for` comum.

O que o AlexNet provou em 2012

Antes do AlexNet, as tarefas de visão computacional eram resolvidas por meio de pipelines manuais de várias etapas: os pesquisadores projetavam manualmente detectores de bordas, texturas e formas, conectando-os em uma cadeia sequencial. Em 2012, o AlexNet entregou todo o processo a uma rede neural, treinando-a na tarefa como um todo, e esmagou os concorrentes na competição ImageNet com uma margem superior a 10 pontos percentuais.

O princípio do treinamento end-to-end desde então prevaleceu em cada nova tarefa de visão computacional:

  • 2012 — classificação de imagens: AlexNet supera métodos manuais em mais de 10%
  • 2013–2015 — detecção de objetos: R-CNN e YOLO substituem pipelines compostos
  • 2015–2017 — segmentação semântica: FCN e U-Net são treinados end-to-end

Cada vez, um único sistema treinável superou o pipeline manual. A lógica é a mesma: em vez de otimizar cada etapa separadamente, é melhor deixar o modelo encontrar uma solução em toda a tarefa como um todo.

Por que os modelos generativos permaneceram como exceção

Os geradores de imagens modernos — modelos de difusão — produzem resultados de forma iterativa: ao longo de dezenas ou centenas de etapas, transformam ruído aleatório em uma imagem. Os modelos autorregressivos funcionam de forma diferente, mas também passo a passo — token por token.

Passar gradientes por esse processo iterativo era computacionalmente proibitivo ou exigia soluções arquitetônicas especiais. Como resultado, os componentes dos sistemas generativos eram tradicionalmente treinados separadamente e combinados manualmente no momento da inferência — exatamente o esquema que o AlexNet provou ser subótimo para tarefas de reconhecimento.

O problema é fundamental: cada etapa de difusão depende da anterior, e a cadeia de dependências rapidamente se torna enorme. Armazenar todo o grafo computacional para a retropropagação através de centenas de etapas leva a uma explosão de memória e gradientes instáveis.

Como um laço for muda a abordagem ao treinamento

Os autores mostram que o processo iterativo de geração pode ser diferenciado simplesmente organizando-o como um laço `for` padrão. Toda a sequência de etapas — do ruído inicial até a imagem final — é unida em uma única cadeia computacional pela qual o gradiente passa.

"O

AlexNet provou algo que desde então foi confirmado repetidamente: entregar a tarefa inteira ao treinamento end-to-end de um modelo é quase sempre melhor do que um pipeline passo a passo cuidadosamente projetado por humanos", — como afirma o artigo da Jiqizhixin.

A analogia com o AlexNet é direta: antes de 2012, as características para reconhecimento de imagens também passavam por um pipeline de várias etapas, e parecia correto otimizar cada etapa separadamente. O AlexNet mostrou que, se você permite que toda a cadeia seja diferenciada como um todo único, o modelo encontra a melhor estratégia por conta própria. Agora o mesmo se aplica ao laço de geração.

Nenhuma nova arquitetura ou otimizador exótico é necessário. A retropropagação padrão, implementada por meio de uma construção básica de linguagem de programação, permite que todo o processo de geração seja treinado como um sistema unificado. Os frameworks modernos — PyTorch e JAX — suportam nativamente a diferenciação de operações dentro de um laço.

O que isso significa

Se o treinamento end-to-end escalar para modelos generativos grandes, poderá mudar os padrões de treinamento deles da mesma forma que o AlexNet mudou as abordagens para tarefas de reconhecimento. Em vez de componentes díspares treinados sequencialmente — um sistema unificado que otimiza independentemente a estratégia de geração. A história do aprendizado profundo mostra: quando um modelo tem a oportunidade de aprender na tarefa como um todo, quase sempre encontra uma solução melhor do que a projetada à mão.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…