أطلقت OpenAI نماذج صوتية GPT-Live-1 و GPT-Live-1 mini لـ ChatGPT
حدثت OpenAI وضع الصوت في ChatGPT: النماذج الجديدة GPT-Live-1 والأخف وزنًا GPT-Live-1 mini تعمل مع بنية ثنائية الاتجاه الكاملة - تستمع وتتحدث في نفس الوقت. الفرق الرئيسي: يمكن للمستخدمين مقاطعة رد المساعد في أي لحظة من المحادثة، بدلاً من انتظار انتهاء النموذج، كما كان الحال من قبل.
معالج بواسطة الذكاء الاصطناعي من 36Kr (36氪)؛ بتحرير Hamidun News
أطلقت OpenAI في أوائل يوليو 2026 جيلاً جديداً من نماذج الصوت لـ ChatGPT—GPT-Live-1 ونسخة مخففة GPT-Live-1 mini، مما نقل تماماً وضع الصوت للمساعد إلى بنية full-duplex. أفاد ملخص التكنولوجيا الصيني 36Kr (36氪) بذلك بالاستناد إلى مصادر.
ما الذي تغير في وضع الصوت بـ ChatGPT
عملت النسخ السابقة من مساعد الصوت بـ ChatGPT وفقاً لمبدأ الأدوار الصارمة: ينطق المستخدم بعبارة، ينتظر النموذج فترة صمت، وعندئذ فقط يصيغ إجابة لا يمكن مقاطعتها حتى النهاية. تغير GPT-Live-1 و GPT-Live-1 mini هذا السيناريو تماماً—كلا النموذجين مبنيان على بنية "full duplex" التي تسمح للنموذج باستقبال كلام المستخدم وإنتاج كلامه في نفس الوقت، بدلاً من العمل بالتناوب.
- تُسمى النماذج الجديدة GPT-Live-1 (الإصدار الرئيسي) و GPT-Live-1 mini (إصدار مخفف، لسيناريوهات أقل استهلاكاً للموارد)
- يتم بناء كلاهما على بنية full-duplex—يحدث الاستقبال والإنتاج الصوتي بالتوازي، وليس بالتسلسل
- يمكن للمستخدم مقاطعة إجابة النموذج في أي نقطة من المحادثة
- أثرت التحديثات على وظيفة الصوت بالكاملة في ChatGPT ككل
لماذا أصبحت المحادثة مع المساعد أكثر طبيعية
العاقبة الرئيسية للـ full duplex هي القضاء على الفترات الصامتة المحرجة والأدوار الصارمة التي تميز روبوتات الصوت من الجيل السابق. إذا وضح مستخدم سؤالاً في منتصف العبارة، أو غيّر الصياغة، أو أراد ببساطة أن يقاطع بقول "انتظر، هذا ليس ما قصدته،" يستجيب GPT-Live-1 على الفور بدلاً من إنهاء إجابة مُنتجة مسبقاً حتى النهاية، كما حدث في أوضاع الصوت السابقة بـ ChatGPT.
من الناحية التقنية، full duplex أكثر تعقيداً من السلسلة المألوفة "التعرف على الكلام → صياغة الإجابة → تجميع الصوت": يجب على النموذج أن يقرر باستمرار ما إذا كان يجب أن يستمر في الكلام أو الاستماع أو القيام بكليهما في نفس الوقت دون إنشاء تأثير صدى ودون فقدان خيط المحادثة. هذا هو بالضبط السبب في بقاء مثل هذه الأنظمة نادرة حتى بين المختبرات الكبرى حتى وقت قريب.
لماذا توجد نسخة مخففة
وجود نموذجين—GPT-Live-1 و GPT-Live-1 mini—هو نهج نموذجي لخدمات الصوت حيث كون تأخير الاستجابة حرجاً للشعور بحوار "مباشر". النسخة المخففة مصممة للسيناريوهات حيث تكون سرعة الاستجابة والحمل الأقل على البنية التحتية أكثر أهمية، بينما يمكن استخدام النموذج الرئيسي حيث تكون جودة ودقة الإجابة هي الأولوية.
حيث سيكون هذا مفيداً أولاً
تكون المرونة في المحادثة ملحوظة بشكل خاص حيث يكون الصوت هو الطريقة الوحيدة للتفاعل مع المساعد: أثناء القيادة، أثناء العمل باليدين، في سيناريوهات الإملاء أو دعم العملاء الصوتي. في مثل هذه الحالات، تشعر ثانية إضافية من الانتظار أو عدم القدرة على تصحيح النموذج بسرعة بحدة أكبر بكثير مما في دردشة نصية حيث يمكن ببساطة إضافة توضيح في الرسالة التالية. يزيل الـ full duplex بالضبط هذا المصدر للإحباط—تسير المحادثة بدون فترات صمت صناعية لـ "تحدث بعد الإشارة".
ما الذي يعنيه هذا
يُظهر إطلاق GPT-Live-1 أن المنافسة في مساعدي الصوت بالذكاء الاصطناعي تحولت من جودة تجميع الكلام البحتة إلى طبيعية الحوار نفسه—إلى أي مدى تشعر المحادثة مع النموذج بأنها حية بدلاً من أن تكون تبادلاً للأسطر مع جهاز الرد الآلي. يحصل المستخدمون الذين يتواصلون بشكل متزايد مع ChatGPT عبر الصوت بدلاً من النص على مساعد يتصرف أقرب إلى شريك محادثة حي مع مقاطعاته وتوضيحاته، بدلاً من قائمة صوتية كلاسيكية مع سيناريوهات صارمة. بالنظر إلى أن Google لديها بالفعل وضع صوتي خاص بها Gemini Live، فإن تحديث محرك الصوت بـ ChatGPT يبدو وكأنه رد مباشر على المنافسة المتزايدة بين المستخدمين الذين يفضلون التحدث مع الذكاء الاصطناعي بدلاً من الكتابة.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.