MarkTechPost→ original

A NVIDIA lançou o Audex-30B — um modelo MoE unificado de áudio e texto baseado no Nemotron-Cascade-2

A NVIDIA lançou o Audex (Nemotron-Labs-Audex-30B-A3B), um modelo multimodal com arquitetura Mixture of Experts que reúne reconhecimento de fala, tradução, síntese de fala, geração de áudio e compreensão de áudio em um único conjunto de pesos. Do total de 30 bilhões de parâmetros, cerca de 3 bilhões são ativados. O principal avanço: as capacidades de texto do modelo-base Nemotron-Cascade-2 foram preservadas com perda mínima.

Processado por IA de MarkTechPost; editado por Hamidun News
A NVIDIA lançou o Audex-30B — um modelo MoE unificado de áudio e texto baseado no Nemotron-Cascade-2
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

NVIDIA lançou Audex-30B em 7 de julho de 2026 — uma rede neural unificada para áudio e fala em uma arquitetura Mixture of Experts, que combina cinco tipos de tarefas de áudio em um único modelo sem perda significativa de capacidades de texto do sistema base.

O que Audex combina em um modelo

Antes de Audex, cada tarefa de áudio exigia uma solução especializada separada: um sistema para reconhecimento de fala, outro para tradução, um terceiro para síntese. NVIDIA os combinou em uma única arquitetura MoE:

  • Compreensão de conteúdo de áudio — análise do conteúdo de arquivos de áudio
  • Reconhecimento Automático de Fala (ASR)
  • Tradução de fala para outro idioma
  • Síntese de fala — text-to-speech (TTS)
  • Geração de áudio

A arquitetura Mixture of Experts permite que o modelo ative apenas parte dos parâmetros dependendo da tarefa específica. Com um volume total de 30 bilhões de parâmetros, aproximadamente 3 bilhões são ativados durante a inferência — daí o sufixo A3B no nome completo. Esta abordagem reduz a carga computacional durante a inferência em comparação com um modelo denso de tamanho total similar.

Por que preservar capacidades de texto é importante

Adicionar uma nova modalidade a um modelo de linguagem já treinado é tradicionalmente acompanhado por "esquecimento catastrófico" — degradação das capacidades de texto originais sob influência do novo treinamento. Este é um dos principais desafios de engenharia ao desenvolver sistemas multimodais.

NVIDIA construiu Audex com base em Nemotron-Cascade-2 — sua própria base de texto com desempenho forte de linguagem. A empresa afirma que a regressão nos benchmarks de texto resultou em perda mínima: capacidades de áudio foram adicionadas sem perda notável de qualidade no trabalho com texto.

A arquitetura MoE desempenha um papel chave aqui: os "especialistas" de áudio e texto dentro do modelo estão parcialmente isolados um do outro, o que reduz a influência mútua das modalidades durante o treinamento. Como resultado, o modelo permanece competente simultaneamente em texto e som — sem compromisso entre as duas áreas.

Para quem isso é relevante

Um modelo multitarefa unificado simplifica o desenvolvimento de produtos de voz e multimodais. Em vez de suportar múltiplos sistemas especializados, uma equipe trabalha com um único peso: mais fácil de implantar, mais fácil de atualizar, mais fácil de monitorar. Uma atualização a um modelo melhora automaticamente todas as cinco funções de uma vez.

Os cenários potenciais de aplicação são amplos: assistentes de voz com compreensão de contexto, sistemas de transcrição e tradução em tempo real, plataformas de voz multilingues para call centers, ferramentas de geração de conteúdo de áudio.

O que isso significa

Audex continua a tendência em direção à construção de modelos fundacionais multimodais com cobertura completa de tarefas. Se antes "áudio + texto" significava uma combinação de vários sistemas especializados, NVIDIA oferece um único peso, cobrindo o espectro completo de tarefas de áudio enquanto preserva a força de texto do modelo base.

O que a rede neural Audex-30B pode fazer?

Combina cinco tipos de tarefas de áudio: compreensão de conteúdo de áudio, reconhecimento automático de fala, síntese, tradução e processamento de som adicional — tudo em um modelo enquanto preserva as capacidades de texto.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…