MarkTechPost→ original

NVIDIA a lancé Audex-30B — un modèle MoE audio-texte unifié basé sur Nemotron-Cascade-2

NVIDIA a lancé Audex (Nemotron-Labs-Audex-30B-A3B), un modèle multimodal fondé sur une architecture Mixture of Experts qui réunit la reconnaissance vocale, la traduction, la synthèse vocale, la génération audio et la compréhension de l’audio dans un seul jeu de poids. Sur un total de 30 milliards de paramètres, environ 3 milliards sont activés. Le point clé : les capacités textuelles du modèle de base Nemotron-Cascade-2 ont été préservées avec une perte minimale.

Traité par IA depuis MarkTechPost ; édité par Hamidun News
NVIDIA a lancé Audex-30B — un modèle MoE audio-texte unifié basé sur Nemotron-Cascade-2
Source : MarkTechPost. Collage: Hamidun News.
◐ Écouter l'article

NVIDIA a lancé Audex-30B le 7 juillet 2026 — un réseau neural unifié pour audio et parole sur une architecture Mixture of Experts, qui combine cinq types de tâches audio dans un seul modèle sans perte significative des capacités textuelles du système de base.

Ce qu'Audex combine dans un modèle

Avant Audex, chaque tâche audio nécessitait une solution spécialisée séparée : un système pour la reconnaissance vocale, un autre pour la traduction, un troisième pour la synthèse. NVIDIA les a combinés dans une unique architecture MoE :

  • Compréhension du contenu audio — analyse du contenu des fichiers audio
  • Reconnaissance Automatique de la Parole (ASR)
  • Traduction vocale dans une autre langue
  • Synthèse vocale — text-to-speech (TTS)
  • Génération d'audio

L'architecture Mixture of Experts permet au modèle d'activer uniquement une partie des paramètres selon la tâche spécifique. Avec un volume total de 30 milliards de paramètres, environ 3 milliards sont activés lors de l'inférence — d'où le suffixe A3B dans le nom complet. Cette approche réduit la charge de calcul lors de l'inférence par rapport à un modèle dense de taille totale similaire.

Pourquoi la préservation des capacités de texte est importante

Ajouter une nouvelle modalité à un modèle de langage déjà entraîné s'accompagne traditionnellement d'un "oubli catastrophique" — dégradation des capacités de texte d'origine sous l'influence du nouvel entraînement. C'est l'un des défis d'ingénierie clés lors du développement de systèmes multimodaux.

NVIDIA a construit Audex sur la base de Nemotron-Cascade-2 — sa propre base de texte avec des performances linguistiques fortes. L'entreprise affirme que la régression sur les benchmarks de texte s'est avérée minimale : les capacités audio ont été ajoutées sans perte notoire de qualité dans le travail avec le texte.

L'architecture MoE joue un rôle clé ici : les "experts" audio et texte au sein du modèle sont partiellement isolés les uns des autres, ce qui réduit l'influence mutuelle des modalités lors de l'entraînement. En résultat, le modèle reste compétent simultanément dans le texte et le son — sans compromis entre les deux domaines.

Pour qui c'est pertinent

Un modèle multitâche unifié simplifie le développement de produits vocaux et multimodaux. Au lieu de soutenir plusieurs systèmes spécialisés, une équipe travaille avec un seul poids : plus facile à déployer, plus facile à mettre à jour, plus facile à surveiller. Une mise à jour d'un modèle améliore automatiquement les cinq fonctions à la fois.

Les scénarios d'application potentiels sont larges : assistants vocaux avec compréhension du contexte, systèmes de transcription et de traduction en temps réel, plateformes vocales multilingues pour les centres d'appels, outils de génération de contenu audio.

Ce que cela signifie

Audex poursuit la tendance à la construction de modèles fondationnels multimodaux avec couverture complète des tâches. Si avant "audio + texte" signifiait une combinaison de plusieurs systèmes spécialisés, NVIDIA offre un seul poids, couvrant le spectre complet des tâches audio tout en préservant la force textuelle du modèle de base.

Que peut faire le réseau neuronal Audex-30B ?

Combine cinq types de tâches audio : compréhension du contenu audio, reconnaissance automatique de la parole, synthèse, traduction et traitement audio supplémentaire — le tout dans un modèle tout en préservant les capacités textuelles.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…