Apple ML Research→ original

Apple confirma: modelos de difusão para fala escalam como os autorregressivos

Apple ML Research publicou um estudo sobre leis de escala para modelos de linguagem de fala com difusão contínua (CD SLM). Modelos CD escalam tão previsívelmente quanto os autorregressivos: a perda diminui com aumento de computação. Uma nova métrica pJSD foi introduzida para medir adequadamente a qualidade linguística da fala sem texto intermediário.

Processado por IA de Apple ML Research; editado por Hamidun News
Apple confirma: modelos de difusão para fala escalam como os autorregressivos
Fonte: Apple ML Research. Colagem: Hamidun News.
◐ Ouvir artigo

Apple ML Research provou que redes neurais para voz escalam tão previsivelmente quanto modelos de texto graças a uma nova métrica pJSD, embora sistemas de voz ainda fiquem atrás de sistemas de texto em qualidade.

Por que modelos de voz ficam atrás de modelos de texto

Modelos de linguagem que trabalham diretamente com som sem representação intermediária de texto — os chamados SLM apenas de voz — atualmente ficam significativamente atrás de sistemas de texto e multimodais. Isso parece paradoxal: interfaces de voz têm demanda, dados de áudio são abundantes, mas o progresso é lento.

A abordagem dominante — SLM autorregressivos discretos (AR SLM) — primeiro converte sinais de áudio contínuos em tokens discretos, semelhante a como modelos de texto funcionam com palavras. O problema é que a fala é fundamentalmente diferente da linguagem escrita: a discretização inevitavelmente perde detalhes acústicos que carregam significado semântico. Para compensar essas perdas, modelos AR requerem enormes recursos computacionais e enormes conjuntos de dados de treinamento — tornando-os caros e difíceis de escalar.

Como difusão contínua contorna limitações

Difusão contínua (CD) oferece uma abordagem radicalmente diferente: trabalhar diretamente com representações contínuas de sinais de áudio, completamente evitando discretização. Isso elimina perda de informação na entrada e potencialmente torna o treinamento mais eficiente.

No entanto, uma pergunta-chave permanecia: os modelos CD obedecem às leis de escala? Essas mesmas leis se tornaram o fundamento dos modernos grandes modelos de linguagem — prevendo como qualidade cresce à medida que parâmetros aumentam e volume de dados se expande. Sem escala previsível, investir recursos importantes em uma arquitetura é arriscado: não há garantia de que investimentos vão se pagar.

Apple investigou ambos os tipos de métricas. Descobertas-chave:

  • CD SLM demonstram leis de escala claras para perda de validação
  • A métrica pJSD (qualidade linguística) diminui previsivelmente conforme computação aumenta
  • Uma relação ótima entre número de tokens e número de parâmetros foi identificada — um análogo de voz da lei de Chinchilla para LLMs de texto
  • O comportamento de escala de modelos CD corresponde proximamente ao de modelos AR

Por que precisamos da nova métrica pJSD

Métricas padrão — principalmente perda — medem como o modelo reproduz precisamente a distribuição de treinamento, mas refletem mal se a fala é substantiva de uma perspectiva linguística. Apple introduziu divergência de Jensen-Shannon de fonemas (pJSD).

A métrica calcula a divergência entre a distribuição de fonemas em fala gerada pelo modelo e fala humana real. Quanto mais próximo o valor estiver de zero, mais "similar ao humano" é a fala em sentido linguístico. Criticamente, pJSD é aplicável a ambas as arquiteturas — AR e CD — permitindo comparação justa de abordagens fundamentalmente diferentes em uma única escala.

"Para avaliar quantitativamente a qualidade linguística de modelos de linguagem de voz, introduzimos a métrica pJSD — divergência de

Jensen-Shannon em nível de fonema", afirma o artigo Apple ML Research.

O que isso significa

A pesquisa da Apple remove uma incerteza-chave em IA de voz: difusão contínua escala previsivelmente e é comparável à abordagem autorregressiva. Isso dá a pesquisadores e empresas justificativa para investimento de longo prazo em arquitetura CD. Sistemas de IA de voz de próxima geração poderão trabalhar sem texto intermediário — potencialmente tornando interação por voz mais natural e computacionalmente eficiente.

O que é uma rede neural para voz?

Este é um modelo de linguagem que trabalha diretamente com som sem representação intermediária de texto — um modelo de linguagem apenas de voz (speech-only SLM).

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…