أطلقت Interfaze نموذج ASR مفتوح المصدر قائمًا على الانتشار للتعرف على ست لغات
في 2 يوليو 2026، فتحت Interfaze الشيفرة المصدرية لنموذج diffusion-gemma-asr-small، وهو نموذج للتعرف على الكلام يعمل بالانتشار لا بالانحدار الذاتي. ويضيف المُحوّل، البالغ نحو 42 مليون معلمة، مدخلات صوتية إلى DiffusionGemma المجمدة من Google ويدعم ست لغات. وتعتمد الكلفة الحاسوبية للتفريغ النصي على عدد خطوات إزالة الضوضاء، لا على طول التسجيل.
معالج بواسطة الذكاء الاصطناعي من MarkTechPost؛ بتحرير Hamidun News
نشرت Interfaze نموذج diffusion-gemma-asr-small في الوصول المفتوح في 2 يوليو 2026 — نموذج متعدد اللغات للتعرف على الكلام الآلي الذي ينقل الصوت من خلال الانتشار بدلاً من الانحدار التلقائي. يتصل محول يزن حوالي 42 مليون معامل بأوزان DiffusionGemma المجمدة من Google ويغطي ستة لغات دون الانقسام إلى فروع خاصة باللغة.
كيف يعمل التعرف على الكلام بالانتشار؟
معظم أنظمة ASR العامة هي انحدار ذاتي: ينشئ النموذج الكتابة بشكل متسلسل، رمز تلو الآخر، وينمو وقت التنفيذ بما يتناسب مع طول التسجيل. Whisper من OpenAI، و MMS و Seamless من Meta، و Distil-Whisper — كلها تعمل بالضبط بهذه الطريقة.
diffusion-gemma-asr-small منظم بشكل مختلف. في جوهره يكمن DiffusionGemma — نموذج اللغة من Google المدرب باستخدام طريقة الانتشار: بدلاً من الإنشاء المتسلسل، يسترجع النص من حالة مزعجة بالتوازي من خلال عدة خطوات إزالة الضوضاء.
أضافت Interfaze محول صوتي إلى هذه القاعدة: يعلم النموذج أن يرتبط إشارة الصوت بالنص المطلوب، بينما تبقى أوزان DiffusionGemma مجمدة ولا تُحدث أثناء تدريب المحول.
النتيجة العملية: يتم تحديد التكلفة الحسابية للكتابة بواسطة عدد خطوات إزالة الضوضاء المحددة، وليس بطول الصوت. يختار المطور نفسه التوازن بين السرعة والجودة — المزيد من الخطوات يعني دقة أعلى، لكن المزيد من الوقت.
ما بداخل النموذج؟
- تاريخ الإصدار في الوصول المفتوح — 2 يوليو 2026
- حجم محول الصوت — حوالي 42 مليون معامل
- النموذج الأساسي — DiffusionGemma من Google (الأوزان مجمدة، غير محدثة)
- اللغات المدعومة — ست لغات (لم يتم الكشف عن القائمة المحددة في الإعلان)
- تعتمد تكلفة الاستنتاج على عدد خطوات إزالة الضوضاء، وليس على طول التسجيل
محول واحد لست لغات — الرهان المعماري الرئيسي. تستخدم معظم النماذج المتعددة اللغات إما رؤوساً خاصة باللغة أو نقطة تفتيش منفصلة لكل لغة. هنا، يحتوي DiffusionGemma بالفعل على تمثيلات نصية متعددة اللغات، والمحول يحتاج فقط إلى تعليم النموذج قبول الصوت — بدون تكرار الأوزان لكل لغة.
للمقارنة: الإصدار الكامل من Whisper large-v3 من OpenAI يحتوي على 1.5 مليار معامل — محول Interfaze أصغر بحوالي 35 مرة من حيث الأوزان القابلة لإعادة التدريب.
ماذا يعني هذا لمطوري ASR؟
نهج الانتشار في التعرف على الكلام نادر في المساحة العامة. يتم بناء معظم أنظمة ASR المفتوحة على الانحدار التلقائي أو فك تشفير CTC. diffusion-gemma-asr-small هو أول مثال عام على إعادة استخدام نموذج لغة انتشاري كخلفية ASR من خلال محول بسيط.
بالنسبة لمجتمع الأبحاث، هذا إثبات المفهوم ونقطة انطلاق: الأوزان المفتوحة تسمح باستكشاف العمارة ومحاولة تكييفها مع المهام ذات الصلة — ASR متعدد اللغات، تبديل الأكواد، التعرف على الكلام الذي يدرك اللهجة.
للتطبيق العملي، هناك حاجة إلى البيانات، والتي لا يكشف عنها الإعلان: اللغات المحددة، الدقة على المعايير القياسية (WER على LibriSpeech و Common Voice و Fleurs)، سرعة الاستنتاج الفعلية مقابل Whisper. بدون هذه الأرقام، من الصعب تقييم القدرة على المنافسة للنموذج في سيناريوهات الإنتاج.
ما يعنيه هذا
فتحت Interfaze اتجاهاً لم يتم استكشافه عملياً — ASR بالانتشار مع إعادة تدريب محول خفيف فقط على نموذج لغة موجود. إذا أكد النهج الجودة التنافسية على المعايير، فسيقدم بديلاً مثيراً للاهتمام للأنظمة الانحدارية: زمن كمون يمكن التنبؤ به، تعديل الجودة المرن من خلال عدد الخطوات، وميزانية وزن مضغوطة.
*Meta معترف بها كمنظمة متطرفة وممنوعة في روسيا.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.