NVIDIA lanzó Audex-30B — un modelo MoE unificado de audio y texto basado en Nemotron-Cascade-2
NVIDIA lanzó Audex (Nemotron-Labs-Audex-30B-A3B), un modelo multimodal con arquitectura Mixture of Experts que combina reconocimiento de voz, traducción, síntesis de voz, generación de audio y comprensión de audio en un único conjunto de pesos. De los 30.000 millones de parámetros totales, se activan unos 3.000 millones. El logro clave: las capacidades de texto del modelo base Nemotron-Cascade-2 se mantuvieron con una pérdida mínima.
Procesado por IA desde MarkTechPost; editado por Hamidun News
NVIDIA lanzó Audex-30B el 7 de julio de 2026 — una red neuronal unificada para audio y voz en una arquitectura Mixture of Experts, que combina cinco tipos de tareas de audio en un único modelo sin pérdida significativa de capacidades de texto del sistema base.
Qué combina Audex en un modelo
Antes de Audex, cada tarea de audio requería una solución especializada separada: un sistema para reconocimiento de voz, otro para traducción, un tercero para síntesis. NVIDIA los combinó en una única arquitectura MoE:
- Comprensión de contenido de audio — análisis del contenido de archivos de audio
- Reconocimiento Automático de Voz (ASR)
- Traducción de voz a otro idioma
- Síntesis de voz — text-to-speech (TTS)
- Generación de audio
La arquitectura Mixture of Experts permite al modelo activar solo parte de los parámetros según la tarea específica. Con un volumen total de 30 mil millones de parámetros, aproximadamente 3 mil millones se activan durante la inferencia — de ahí el sufijo A3B en el nombre completo. Este enfoque reduce la carga computacional durante la inferencia en comparación con un modelo denso de tamaño total similar.
Por qué es importante preservar capacidades de texto
Añadir una nueva modalidad a un modelo de lenguaje ya entrenado va tradicionalmente acompañado de "olvido catastrófico" — degradación de las capacidades de texto originales bajo la influencia del nuevo entrenamiento. Este es uno de los desafíos de ingeniería clave al desarrollar sistemas multimodales.
NVIDIA construyó Audex sobre la base de Nemotron-Cascade-2 — su propia base de texto con sólido desempeño del lenguaje. La empresa afirma que la regresión en los puntos de referencia de texto resultó ser mínima: se añadieron capacidades de audio sin pérdida notable de calidad en el trabajo con texto.
La arquitectura MoE juega un papel clave aquí: los "expertos" de audio y texto dentro del modelo están parcialmente aislados entre sí, lo que reduce la influencia mutua de modalidades durante el entrenamiento. Como resultado, el modelo permanece competente simultáneamente en texto y sonido — sin compromiso entre las dos áreas.
Para quién es relevante esto
Un modelo multitarea unificado simplifica el desarrollo de productos de voz y multimodales. En lugar de soportar múltiples sistemas especializados, un equipo trabaja con un único peso: más fácil de desplegar, más fácil de actualizar, más fácil de monitorear. Una actualización de un modelo mejora automáticamente las cinco funciones a la vez.
Los escenarios de aplicación potencial son amplios: asistentes de voz con comprensión de contexto, sistemas de transcripción y traducción en tiempo real, plataformas de voz multilingües para centros de llamadas, herramientas de generación de contenido de audio.
Qué significa esto
Audex continúa la tendencia hacia la construcción de modelos multimodales fundamentales con cobertura completa de tareas. Si antes "audio + texto" significaba una combinación de varios sistemas especializados, NVIDIA ofrece un único peso, cubriendo el espectro completo de tareas de audio mientras se preserva la fortaleza del texto del modelo base.
¿Qué puede hacer la red neuronal Audex-30B?
Combina cinco tipos de tareas de audio: comprensión de contenido de audio, reconocimiento automático de voz, síntesis, traducción y procesamiento de sonido adicional — todo en un modelo mientras se preservan las capacidades de texto.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.