MarkTechPost→ المصدر

أطلقت NVIDIA نموذج Audex-30B — وهو نموذج MoE موحد للصوت والنص قائم على Nemotron-Cascade-2

أطلقت NVIDIA نموذج Audex (Nemotron-Labs-Audex-30B-A3B)، وهو نموذج متعدد الوسائط يعتمد على معمارية Mixture of Experts ويجمع بين التعرف على الكلام والترجمة وتوليف الكلام وتوليد الصوت وفهم الصوت ضمن مجموعة أوزان واحدة. ومن إجمالي 30 مليار معلمة، يُفعَّل نحو 3 مليارات فقط. الإنجاز الأساسي: جرى الحفاظ على القدرات النصية للنموذج الأساسي Nemotron-Cascade-2 مع تراجع محدود.

معالج بواسطة الذكاء الاصطناعي من MarkTechPost؛ بتحرير Hamidun News
أطلقت NVIDIA نموذج Audex-30B — وهو نموذج MoE موحد للصوت والنص قائم على Nemotron-Cascade-2
المصدر: MarkTechPost. كولاج: Hamidun News.
◐ استمع للمقال

أطلقت NVIDIA Audex-30B في 7 يوليو 2026 — شبكة عصبية موحدة للصوت والكلام على معمارية Mixture of Experts، التي تجمع خمسة أنواع من مهام الصوت في نموذج واحد بدون فقدان كبير لقدرات النص من النظام الأساسي.

ما يجمعه Audex في نموذج واحد

قبل Audex، كانت كل مهمة صوت تتطلب حلاً متخصصاً منفصلاً: نظام واحد للتعرف على الكلام، وآخر للترجمة، وثالث للتركيب. دمجتها NVIDIA في معمارية MoE واحدة:

  • فهم محتوى الصوت — تحليل محتوى ملفات الصوت
  • التعرف الآلي على الكلام (ASR)
  • ترجمة الكلام إلى لغة أخرى
  • تركيب الكلام — text-to-speech (TTS)
  • توليد الصوت

تسمح معمارية Mixture of Experts للنموذج بتنشيط جزء فقط من المعاملات حسب المهمة المحددة. مع حجم إجمالي قدره 30 مليار معامل، يتم تنشيط حوالي 3 مليارات أثناء الاستدلال — ومن هنا اللاحقة A3B في الاسم الكامل. يقلل هذا النهج العبء الحسابي أثناء الاستدلال مقارنة بنموذج كثيف بحجم إجمالي مماثل.

لماذا الحفاظ على قدرات النص مهم

إضافة جهات جديدة إلى نموذج لغة مدرب بالفعل يصحبها تقليدياً "نسيان كارثي" — تدهور قدرات النص الأصلية تحت تأثير التدريب الجديد. هذا هو أحد التحديات الهندسية الرئيسية عند تطوير الأنظمة متعددة الأسلوب.

بنت NVIDIA Audex على أساس Nemotron-Cascade-2 — قاعدة نصها الخاصة بأداء لغة قوي. تؤكد الشركة أن الانحدار على معايير النص كان ضئيلاً: تمت إضافة قدرات صوت بدون خسارة ملحوظة في الجودة عند العمل مع النص.

تلعب معمارية MoE دوراً رئيسياً هنا: "الخبراء" الصوت والنص داخل النموذج معزولون جزئياً عن بعضهما البعض، مما يقلل التأثير المتبادل للأسلوب أثناء التدريب. نتيجة لذلك، يظل النموذج مختصاً في نفس الوقت في النص والصوت — بدون مساومة بين المنطقتين.

لمن هذا ذو صلة

نموذج متعدد المهام موحد يبسط تطوير منتجات صوتية ومتعددة الأسلوب. بدلاً من دعم أنظمة متخصصة متعددة، يعمل الفريق مع وزن واحد: أسهل في النشر، أسهل في التحديث، أسهل في المراقبة. يحسن تحديث نموذج واحد تلقائياً جميع الوظائف الخمس في المرة الواحدة.

سيناريوهات التطبيق المحتملة واسعة النطاق: مساعدات صوتية مع فهم السياق، أنظمة النسخ الدقيق والترجمة في الوقت الفعلي، منصات صوتية متعددة اللغات لمراكز الاتصالات، أدوات توليد محتوى صوت.

ماذا يعني هذا

يستمر Audex في الاتجاه نحو بناء نماذج تأسيسية متعددة الأسلوب مع تغطية كاملة للمهام. إذا كانت "الصوت + النص" من قبل تعني مزيجاً من عدة أنظمة متخصصة، فإن NVIDIA تقدم وزناً واحداً، يغطي الطيف الكامل لمهام الصوت مع الحفاظ على قوة النص في النموذج الأساسي.

ماذا يمكن لشبكة Audex-30B العصبية أن تفعل؟

تجمع خمسة أنواع من مهام الصوت: فهم محتوى الصوت، التعرف الآلي على الكلام، التركيب، الترجمة ومعالجة الصوت الإضافية — كل هذا في نموذج واحد مع الحفاظ على القدرات النصية.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…