ZDNet AI→ المصدر

ChatGPT Live Voice: يتعلم الوضع الصوتي البحث على الإنترنت أثناء المحادثة

اختبر كاتب ZDNet وضع ChatGPT الصوتي المحدث — Live Voice. يمكن لنماذج الصوت الجديدة الاستماع إلى المستخدم والرد بالصوت وإجراء عمليات بحث مباشرة على الإنترنت في نفس الوقت، دون تقسيم المحادثة إلى خطوات منفصلة 'سؤال — توقف — إجابة'. وفقًا لانطباعات المؤلف، فإن الحوار المباشر مع المساعد 'يكاد' لا يمكن تمييزه عن التحدث مع شخص حقيقي.

معالج بواسطة الذكاء الاصطناعي من ZDNet AI؛ بتحرير Hamidun News
ChatGPT Live Voice: يتعلم الوضع الصوتي البحث على الإنترنت أثناء المحادثة
المصدر: ZDNet AI. كولاج: Hamidun News.
◐ استمع للمقال

اختبر ناقد ZDNet النسخة المحدثة من وضع الصوت في ChatGPT — Live Voice — ولاحظ أن المحادثة مع المساعد "تقريباً" تشعر مثل التواصل مع شخص حقيقي.

ما الجديد في Live Voice

الفرق الرئيسي مع نماذج الصوت الجديدة ChatGPT هو أنها يمكنها الاستماع إلى المستخدم والرد بصوت والبحث عن معلومات على الإنترنت في نفس الوقت دون كسر المحادثة إلى خطوات منفصلة من "سأل — انتظر — حصل على إجابة". في السابق، كان الحوار الصوتي مع ChatGPT مهيكلاً بشكل مختلف: أظهرت OpenAI Advanced Voice Mode في عام 2024 مع نموذج GPT-4o — ثم كان التركيز على كمون الاستجابة المنخفض والنبرات الطبيعية والقدرة على مقاطعة المساعد في منتصف الجملة، لكن لم يكن هناك بحث ويب مباشر مباشرة أثناء المحادثة، وكان المساعد يأخذ توقفة للعثور على حقائق حالية.

  • يمكن لـ Live Voice الاستماع والتحدث والبحث على الإنترنت في نفس الوقت
  • الميزة مدمجة في نماذج الصوت الحالية ChatGPT
  • يصف ناقد ZDNet الحوار مع المساعد بأنه "تقريباً" لا يمكن تمييزه عن التحدث مع شخص

كيف يشعر هذا في الممارسة

وفقاً لناقد ZDNet الذي اختبر الميزة، طبيعية المحادثة هي الانطباع الرئيسي من التحديث: المساعد يرد بسرعة كافية وبسلاسة بحيث لا توحي التوقفة قبل الإجابة برنامج في المتحدث. في الوقت نفسه، المادة نفسها مؤطرة كمراجعة للتجربة الشخصية وتعليمات عن "كيفية تجربتها"، بدلاً من أن تكون إعلاناً عن خصائص تقنية محددة للنموذج — أي أننا نتحدث عن الانطباع الذاتي للمستخدم، وليس قياسات الكمون أو الدقة.

كيف يختلف هذا عن المنافسين

القدرة على إجراء عمليات بحث واسعة النطاق في الوقت الفعلي مباشرة أثناء مكالمة صوتية هي اتجاه تتحرك فيه عدة شركات ذكاء اصطناعي كبرى في نفس الوقت: يتم تطوير مبدأ مماثل لمساعد صوتي "مباشر" مع الوصول إلى الإنترنت من قبل Google في سلسلة Gemini Live. بالنسبة للسوق، هذا يعني أن واجهة الصوت تتوقف عن كونها مجرد طريقة لإملاء استعلام نصي، والذي يتم معالجته بعد ذلك كدردشة نصية عادية، وتصبح قناة منفصلة للتفاعل الكامل مع المساعد — مع وتيرتها الخاصة والفترات الزمنية والقدرة على العمل أثناء المحادثة.

حيث يمكن أن يكون هذا مفيداً في الممارسة

مساعد صوتي يستمع في نفس الوقت ويبحث عن إجابات على الإنترنت يكون مفيداً بالضبط في الحالات التي تكون فيها يديك وعيناك مشغولاً بشيء آخر: أثناء القيادة أو في المطبخ أثناء الطهي أو ببساطة عندما يكون من غير المريح الكتابة على الهاتف. في السابق في مثل هذه الحالات، كان عليك انتظار انتهاء المساعد من "التفكير" بعد سؤال، أو التبديل إلى الوضع النصي إذا كنت تحتاج إلى حقيقة حالية دقيقة — تزيل النسخة الجديدة هذه الفجوة بين المحادثة والبحث.

ما يعنيه هذا

تستمر واجهات الصوت لمساعدي الذكاء الاصطناعي في الانتقال من تحويل الكلام إلى نص البسيط إلى نماذج يمكنها العمل أثناء المحادثة — البحث والتوضيح والرد تقريباً دون تأخير — وهذه الخاصية السلاسة، وليس ميزة منفصلة وحقيقية، هي ما يترك انطباعاً على المستخدمين بمساعد "شبه حقيقي".

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…