A NVIDIA lançou o Audex-30B — um modelo MoE unificado de áudio e texto baseado no Nemotron-Cascade-2
A NVIDIA lançou o Audex (Nemotron-Labs-Audex-30B-A3B), um modelo multimodal com arquitetura Mixture of Experts que reúne reconhecimento de fala, tradução, síntese de fala, geração de áudio e compreensão de áudio em um único conjunto de pesos. Do total de 30 bilhões de parâmetros, cerca de 3 bilhões são ativados. O principal avanço: as capacidades de texto do modelo-base Nemotron-Cascade-2 foram preservadas com perda mínima.
Processado por IA de MarkTechPost; editado por Hamidun News
NVIDIA lançou Audex-30B em 7 de julho de 2026 — uma rede neural unificada para áudio e fala em uma arquitetura Mixture of Experts, que combina cinco tipos de tarefas de áudio em um único modelo sem perda significativa de capacidades de texto do sistema base.
O que Audex combina em um modelo
Antes de Audex, cada tarefa de áudio exigia uma solução especializada separada: um sistema para reconhecimento de fala, outro para tradução, um terceiro para síntese. NVIDIA os combinou em uma única arquitetura MoE:
- Compreensão de conteúdo de áudio — análise do conteúdo de arquivos de áudio
- Reconhecimento Automático de Fala (ASR)
- Tradução de fala para outro idioma
- Síntese de fala — text-to-speech (TTS)
- Geração de áudio
A arquitetura Mixture of Experts permite que o modelo ative apenas parte dos parâmetros dependendo da tarefa específica. Com um volume total de 30 bilhões de parâmetros, aproximadamente 3 bilhões são ativados durante a inferência — daí o sufixo A3B no nome completo. Esta abordagem reduz a carga computacional durante a inferência em comparação com um modelo denso de tamanho total similar.
Por que preservar capacidades de texto é importante
Adicionar uma nova modalidade a um modelo de linguagem já treinado é tradicionalmente acompanhado por "esquecimento catastrófico" — degradação das capacidades de texto originais sob influência do novo treinamento. Este é um dos principais desafios de engenharia ao desenvolver sistemas multimodais.
NVIDIA construiu Audex com base em Nemotron-Cascade-2 — sua própria base de texto com desempenho forte de linguagem. A empresa afirma que a regressão nos benchmarks de texto resultou em perda mínima: capacidades de áudio foram adicionadas sem perda notável de qualidade no trabalho com texto.
A arquitetura MoE desempenha um papel chave aqui: os "especialistas" de áudio e texto dentro do modelo estão parcialmente isolados um do outro, o que reduz a influência mútua das modalidades durante o treinamento. Como resultado, o modelo permanece competente simultaneamente em texto e som — sem compromisso entre as duas áreas.
Para quem isso é relevante
Um modelo multitarefa unificado simplifica o desenvolvimento de produtos de voz e multimodais. Em vez de suportar múltiplos sistemas especializados, uma equipe trabalha com um único peso: mais fácil de implantar, mais fácil de atualizar, mais fácil de monitorar. Uma atualização a um modelo melhora automaticamente todas as cinco funções de uma vez.
Os cenários potenciais de aplicação são amplos: assistentes de voz com compreensão de contexto, sistemas de transcrição e tradução em tempo real, plataformas de voz multilingues para call centers, ferramentas de geração de conteúdo de áudio.
O que isso significa
Audex continua a tendência em direção à construção de modelos fundacionais multimodais com cobertura completa de tarefas. Se antes "áudio + texto" significava uma combinação de vários sistemas especializados, NVIDIA oferece um único peso, cobrindo o espectro completo de tarefas de áudio enquanto preserva a força de texto do modelo base.
O que a rede neural Audex-30B pode fazer?
Combina cinco tipos de tarefas de áudio: compreensão de conteúdo de áudio, reconhecimento automático de fala, síntese, tradução e processamento de som adicional — tudo em um modelo enquanto preserva as capacidades de texto.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.