عرضت Microsoft كيفية تشغيل VibeVoice لـ ASR وrealtime TTS وspeech-to-speech
أطلقت Microsoft دليلاً عمليًا على Colab حول VibeVoice يغطّي مكدس الصوت بالكامل: speaker-aware ASR، والتعرّف context-aware، وrealtime TTS، ومسار speech-to-speech بسيط. ويعرض الـnotebook إعداد البيئة من الصفر، والمعالجة الدفعية للصوت، واختيار الأصوات، وواجهة Gradio، وتوليد long-form، وأساليب توفير الذاكرة للتسجيلات الطويلة، لذا يمكن استخدام المادة مباشرة كأساس لنموذج أولي صوتي.
معالج بواسطة الذكاء الاصطناعي من MarkTechPost؛ بتحرير Hamidun News
أطلقت Microsoft دليلاً عملياً تفصيلياً حول VibeVoice — مجموعة مفتوحة المصدر لتحقيق الكلام والتوليف الصوتي. في دفتر ملاحظات Colab واحد، يرى المطورون سير العمل الكامل: من إعداد البيئة وتحميل النماذج إلى بناء خط أنابيب بسيط للكلام إلى الكلام.
كيفية تنظيم الدليل
يبدأ الدليل بإعداد بيئة قابلة للتكرار بالكامل في Google Colab. يقوم المطور بحذف الإصدار القديم من Transformers، وتثبيت نسخة حديثة من GitHub، وإضافة torch و torchaudio و gradio واستنساخ مستودع VibeVoice الرسمي. بعد ذلك، يتحقق دفتر الملاحظات من أن الفئات المطلوبة متاحة فعلاً، ثم يتصل بأمثلة صوتية جاهزة. الصيغة عملية جداً: ليست نظرة عامة على الإمكانيات بالكلمات، بل سيناريو يمكن تكراره خطوة بخطوة وتكييفه بسرعة مع مشروعك الخاص.
بعد ذلك، ينتقل دفتر الملاحظات إلى التعرف على الكلام. في العرض التوضيحي، يتم تحميل VibeVoice-ASR-HF بـ 7 مليارات معامل، وتؤكد Microsoft على حدة قدرته على معالجة ما يصل إلى 60 دقيقة من الصوت في ممر واحد. يعرض البرنامج التعليمي ليس فقط نسخ النص، بل مخرجات منظمة مع تقسيم المتحدثين والرموز الزمنية ومحتوى الملاحظات. بالنسبة للاجتماعات والمقابلات والبودكاست واتصالات الدعم، هذا فرق مهم: يجب أن يجيب النموذج على ثلاثة أسئلة في نفس الوقت — من تحدث، ومتى، وما الذي قيل بالضبط.
ما الذي يمكن لهذه المجموعة أن تفعله
يتم التركيز بشكل منفصل على الاعتراف الذي يراعي السياق. في دفتر الملاحظات، يتم تشغيل نفس التسجيل بدون تلميحات وبالسياق، وتتم مقارنة النتيجة مباشرة. يوضح هذا المثال أن الكلمات الأساسية تساعد على الاعتراف بأسماء المنتجات والأسماء والمصطلحات الصناعية بدقة أكبر. بالنسبة لحالات الاستخدام المؤسسية، هذا أكثر فائدة من تحويل الكلام إلى نص العادي، لأن الخطأ في كلمة أساسية واحدة يمكن أن يفسد البحث في أرشيف المكالمات أو تحليل الاجتماعات أو عمل الوكيل اللاحق.
بعد نموذج التعرف على الكلام، ينتقل المؤلفون إلى التوليف في الوقت الفعلي. لهذا، يتم استخدام VibeVoice-Realtime-0.5B — نموذج خفيف الوزن يدعم إدخال النص بشكل متدفق وبحسب وصف Microsoft، قادر على تقديم أول جزء مسموع في حوالي 300 ميلي ثانية. في المثال، يتم تحديد أربع إعدادات صوتية، وتعديل عدد خطوات الاستدلال وحجم CFG، ثم يتم إنشاء كل من الكلام القصير وجزء أطول بتنسيق البودكاست المصغر. أي أنهم يعرضون ليس فقط تحويل النص إلى كلام الأساسي، بل أيضاً التوازن بين السرعة والجودة والقابلية للتحكم.
- نسخ يراعي المتحدث مع الرموز الزمنية
- تحقيق الكلام الواعي بالسياق والكلمات الأساسية
- معالجة دفعات ملفات صوتية متعددة
- تحويل النص إلى كلام في الوقت الفعلي مع أصوات متعددة
- خط أنابيب بسيط التعرف على الكلام → الإجابة → توليف الصوت
لا ينتهي الدليل هنا. في قسم منفصل، يتم تجميع سيناريو أساسي للكلام إلى الكلام: يقوم النظام أولاً بنسخ ملف الصوت المدخل، ثم يولد استجابة نصية ويوليفها مباشرة إلى كلام. بالتوازي، تتم مراقبة معالجة دفعات ملفات متعددة وتوليف الشكل الطويل، حيث يوليف النموذج نصاً أطول دون انهيار التنغيم في الفقرات الأولى.
بالنسبة للمطور، هذا لم يعد مجموعة من العروض التوضيحية المنفصلة، بل مسودة واجهة صوتية حقيقية.
الممارسة في Colab
الجزء الأخير مفيد لأنه يتحرك بعيداً عن واجهة العرض الجميلة نحو الاستغلال. يتم رفع واجهة Gradio بسيطة لتحويل النص إلى كلام التفاعلي في دفتر الملاحظات، وفي ما يلي يُقترح عليك تحميل ملف WAV أو MP3 أو FLAC الخاص بك وتشغيله من خلال التعرف على الكلام على بيانات خاصة بك. يتم جمع نصائح الذاكرة أيضاً: تقليل حجم الجزء للصوت الطويل، والتبديل إلى bfloat16، وتقليل عدد خطوات تحويل النص إلى كلام، وإذا لزم الأمر، مسح ذاكرة تخزين GPU مؤقتة. بالنسبة إلى Colab، هذا ليس تفصيلاً صغيراً، بل الفرق بين التشغيل الناجح والفشل في الذاكرة.
تضيف Microsoft أيضاً قسماً عن إرشادات الاستخدام. في الملخص النهائي، يُذكر بوضوح أن المجموعة تُنشر للبحث والتطوير، ويجب تحديد الكلام الذي ينشئه الذكاء الاصطناعي بشكل صريح. بشكل منفصل، يُذكر أنه لا يمكن استخدام هذه الأدوات لانتحال شخصية شخص آخر أو للاحتيال. هذه تفصيلة مهمة: الشركة تروج لذكاء صوتي مفتوح المصدر ليس كلعبة، بل كبنية تحتية تتلقى على الفور قواعد أساسية للتطبيق الآمن.
ماذا يعني هذا
ينتقل VibeVoice تدريجياً من وضع إصدار البحث نحو أدوات مطور مفهومة. عندما توفر Microsoft ليس فقط أوزان النماذج، بل أيضاً سيناريو Colab قابل للتكرار للتعرف على الكلام وتحويل النص إلى كلام في الوقت الفعلي والكلام إلى الكلام، تنخفض الحاجز أمام الدخول إلى منتجات الصوت: يمكن للفرق بسهولة أكبر وبسرعة أكبر تجميع نموذج أولي من محرر النصوص أو مساعد صوتي أو واجهة لمعالجة تسجيلات صوتية طويلة دون ربط يدوي طويل لأدوات مختلفة.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.