أنشأت VK و HSE نموذج ذكاء اصطناعي خفيف الوزن لقمع الضوضاء وإزالة الصدى في الوقت الفعلي
أنشأ المطور زاخار كونداوروف، بدعم من VK والمدرسة الهندسية الرياضية في HSE، نموذجاً خفيف الوزن يتعامل مع قمع الضوضاء وإزالة صدى الصوت في الوقت الفعلي بمعدل أخذ العينات الكامل 48 كيلوهرتز. تتعامل معظم الحلول الموجودة مع هذه المهام بشكل منفصل وتعمل بشكل أسوأ على الصوت ذي النطاق الكامل، مما يجعل من الصعب معالجة الكلام محلياً على الأجهزة منخفضة الطاقة.
معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
طور زاخار كونداوروف، وهو مطور في مدرسة الهندسة والرياضيات بجامعة البحث الاقتصادي الحكومية الوطنية، تحت إشراف إيفان بيسكروفني، رئيس فريق تقنيات الصوت في VK Video، نموذجًا خفيف الوزن يحل بشكل متزامن مشاكل قمع الضوضاء وإزالة الصدى من إشارات الصوت في الوقت الفعلي.
لماذا هذه المهمة أكثر تعقيدًا مما تبدو عليه
معظم الأبحاث في تحسين الكلام تقتصر على قمع الضوضاء فقط، على الرغم من أن البنى الحديثة تسمح بحل مشكلة أكثر تعقيدًا — قمع الضوضاء المشترك وإزالة الصدى. السبب يكمن في انحياز صناعي: هناك معايير قياس وموديلات جاهزة أكثر بكثير لقمع الضوضاء مقارنة بالتعامل مع تشوهات الإشارة الأخرى، بما في ذلك الصدى، مما يجعل من الصعب مقارنة الحلول الجديدة.
- مؤلف المشروع هو زاخار كونداوروف، مشارك في مدرسة الهندسة والرياضيات بجامعة البحث الاقتصادي الحكومية الوطنية
- تم إجراء العمل بالتعاون مع VK تحت إشراف إيفان بيسكروفني، رئيس فريق تقنيات الصوت في VK Video
- تم تدريب معظم الحلول الموجودة على صوت بمعدل عينات 16 كيلوهرتز، وليس 48 كيلوهرتز بالنطاق الكامل
- عادة ما يتم حل قمع الضوضاء وإزالة الصدى بشكل متسلسل باستخدام شبكتي عصبيتين مختلفتين
ما الذي يوفره النموذج ذو النطاق الكامل
يقلل تحديد 16 كيلوهرتز بشكل كبير من نطاق الترددات في الإشارة المعالجة — يتم ببساطة تجاهل المراقي العليا للكلام والتفاصيل الدقيقة للصوت. يحافظ النموذج المدرب على صوت بنطاق كامل بـ 48 كيلوهرتز على معلومات صوتية أكثر بكثير، وهو أمر مهم للخدمات الصوتية مثل مكالمات الفيديو والبث المباشر، حيث تعمل فريق VK Video.
غالبًا ما يتم حل قمع الضوضاء وإزالة الصدى حاليًا بشكل متسلسل: أولاً تزيل شبكة عصبية واحدة الضوضاء الخارجية، ثم تحارب شبكة ثانية الصدى والصوتيات في الغرفة. يستهلك هذا الخط الأنابيب ذاكرة أكثر ووقت معالجة أكثر من نموذج واحد يتعامل مع المهمتين في نفس الوقت. يسمح دمج المهام في بنية واحدة للأجهزة ذات الموارد المحدودة — الهواتف الذكية وأجهزة الكمبيوتر المحمولة والسماعات الرأسية — بمعالجة الكلام محليًا دون إرسال دفق الصوت إلى خادم، وبالتالي تقليل حمل البنية الأساسية وزمن استجابة النظام.
ماذا يعني هذا
يوضح المشروع الاتجاه الذي تتجه إليه صناعة معالجة الكلام: بدلاً من سلسلة من الشبكات العصبية المتخصصة بشكل ضيق — نموذج بنطاق كامل واحد مضغوط يمكن تشغيله مباشرة على جهاز المستخدم، بدلاً من إرسال الصوت عبر خادم للحصول على صوت نظيف في مكالمة أو بث.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.