GPT-Live от OpenAI: как построили голосовой ИИ без пауз между репликами
OpenAI за шесть месяцев создала GPT-Live — систему непрерывного голосового взаимодействия с ИИ. В отличие от обычных ассистентов, она не ждёт паузы в речи: turnless-модель обрабатывает аудио непрерывно, без разрыва между репликами. Разговор с ИИ становится ближе к живому диалогу.
معالج بواسطة الذكاء الاصطناعي من OpenAI Blog؛ بتحرير Hamidun News
نشرت OpenAI على مدونتها روايةً تفصيليةً عن كيفية بناء مهندسي الشركة لنظام GPT-Live — نظام التفاعل الصوتي المستمر مع الذكاء الاصطناعي — في غضون ستة أشهر. يستند المنتج إلى نموذج كلام بلا أدوار (turnless) وبنية تحتية منخفضة الكُمون، مما يُتيح معاً حواراً أسرع وأكثر طبيعيةً بين الإنسان والذكاء الاصطناعي.
ما الذي يميّز GPT-Live عن مساعدات الصوت التقليدية
تعمل معظم أنظمة الذكاء الاصطناعي الصوتية، بما فيها الإصدارات الأولى من Voice Mode في ChatGPT، وفق نموذج التناوب في الأدوار. المبدأ بسيط: يستمع الذكاء الاصطناعي إلى المستخدم، ويكتشف توقفاً، ويعدّه نهايةَ دور — ولا يصيغ الرد إلا بعد ذلك. يُفضي هذا إلى تأخيرات ملحوظة، ولا يُتيح مقاطعة النظام في منتصف الكلام، وهو ما لا يتسق مع طبيعة الحديث الحي.
بُني GPT-Live بطريقة مختلفة. وفقاً لمدونة OpenAI، يستخدم النظام بنيةً بلا أدوار (turnless): يعالج النموذج الكلامَ الوارد باستمرار، دون حدود صارمة بين الأدوار. يمكن للمستخدم التوضيح أو تغيير الموضوع أو المقاطعة في أي لحظة خلال التفاعل — ويستجيب النظام دون انتظار ملحوظ.
الخصائص الرئيسية لـ GPT-Live كما وصفتها OpenAI:
- نموذج الكلام بلا أدوار (Turnless speech model) — معالجة الصوت دون فصل ثابت بين أدوار المستخدم وردود الذكاء الاصطناعي
- بنية منخفضة الكُمون (Low-latency architecture) — كل طبقة من طبقات المكدّس مُحسَّنة لأدنى وقت استجابة
- البثّ المباشر في الوقت الفعلي — يُعالَج الصوت كتدفق مستمر، دون تراكم طوابير الانتظار
- ستة أشهر — المدة من التصور المعماري إلى إطلاق النظام في الإنتاج
لماذا تعذّر تحسين النظام القديم ببساطة
يتألف pipeline الصوت القياسي من ثلاثة مكوّنات متتالية: التعرّف على الكلام (ASR)، ونموذج اللغة، وتوليف الكلام (TTS). تنتظر كل مرحلة نتيجةَ سابقتها. هذا النظام موثوق وقابل للتنبؤ، لكنه غير مناسب جوهرياً للتفاعل المستمر: إذ لم يُصمَّم للبثّ الصوتي ثنائي الاتجاه في الوقت الفعلي.
وفقاً لمدونة OpenAI، قرّر المهندسون بناء نظام الوقت الفعلي من الصفر، بدلاً من تكييف البنية التحتية القائمة. وأصبح الكُمون القيدَ الأساسي في التصميم: كل مكوّن — من النموذج إلى النشر — أُنشئ مع مراعاة ذلك.
«يوفّر GPT-Live تفاعلاً صوتياً مستمراً مع الذكاء الاصطناعي، مستخدماً نموذج الكلام بلا أدوار وبنية منخفضة الكُمون لمحادثات أسرع وأكثر طبيعية»، كما ورد في المدونة الرسمية لـ
OpenAI.
تشمل الأشهر الستة من التصور إلى الإطلاق الدورةَ الهندسية الكاملة: القرارات المعمارية، والنمذجة الأولية، وتحسين الكُمون، والنشر في بيئة الإنتاج.
كيف يُغيّر GPT-Live الحوار مع الذكاء الاصطناعي بالفعل
يُشغّل GPT-Live نظامَ Advanced Voice Mode في ChatGPT — وهو النظام الذي يقوم عليه وضع الصوت في التطبيق. بالنسبة للمستخدم النهائي، الفارق ملموس: بدلاً من محادثة مليئة بالتوقفات والانتظار، ثمة حوار سلس وسريع الاستجابة. مقاطعة الذكاء الاصطناعي في منتصف الجملة، وطرح سؤال توضيحي في الأثناء، وتغيير الموضوع — كل هذا يعمل الآن دون انقطاعات ملحوظة، كما في مكالمة هاتفية عادية.
تُرسي المقاربة بلا أدوار والبنى منخفضة الكُمون معياراً هندسياً جديداً للذكاء الاصطناعي الصوتي. ستضع الشركات التي تطوّر مشغّلين صوتيين لمراكز الاتصال، ومساعدات مدمجة في السيارات، وواجهات صوتية لذوي الإعاقة، هذا المستوى نصبَ أعينها عند تصميم الجيل القادم من أنظمتها.
ما الذي يعنيه هذا
في ستة أشهر، أعادت OpenAI تصوّرَ المبدأ الجوهري للذكاء الاصطناعي الصوتي — من التناوب في الأدوار إلى الحوار المستمر. GPT-Live ليس تحسيناً تدريجياً، بل تحوّلاً في النموذج المعماري. سرعة الاستجابة وسلاسة الحوار لم تعودا ميزةً إضافية، بل أصبحتا معياراً أساسياً يتعيّن على سوق أنظمة الذكاء الاصطناعي الصوتي بأسره الوفاءُ به.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.