أطلقت OpenAI GPT-Realtime-2.1 وإصدار Mini لوكلاء الصوت في API
أطلقت OpenAI نموذجين جديدين في سطر Realtime إلى API الخاصة بها—GPT-Realtime-2.1 وإصدار خفيف الوزن GPT-Realtime-2.1-mini لوكلاء الصوت. يعمل إصدار mini كنموذج استدلال مضغوط للصوت ويكلف نفس سعر gpt-realtime-mini السابق. بفضل التخزين المؤقت المحسّن، تم تقليل زمن التأخير p95 بنسبة 25% على الأقل؛ تعمل الاتصال عبر بروتوكول WebRTC.
معالج بواسطة الذكاء الاصطناعي من MarkTechPost؛ بتحرير Hamidun News
أضافت OpenAI نموذجين جديدين إلى مجموعة API في الوقت الفعلي — GPT-Realtime-2.1 والإصدار الخفيف GPT-Realtime-2.1-mini، والمصممة لوكلاء الصوت بزمن استجابة منخفض.
ما هو الجديد في مجموعة Realtime
GPT-Realtime-2.1-mini هو نموذج استدلال مدمج موجه نحو سيناريوهات الصوت. من حيث السعر، فإنه يتوافق مع gpt-realtime-mini السابق، مما يعني أن الانتقال إلى الإصدار الجديد لا يزيد من تكلفة الاستخدام للمطورين الذين يعملون بالفعل مع نموذج mini السابق. تم إنشاء مجموعة API Realtime في OpenAI في الأصل للمهام التي لا تناسب فيها نماذج النصوص ذات إنشاء الاستجابة المتوسطة: مساعدات صوتية وواجهات دعم محادثة والوكلاء الذين يحتاجون إلى الرد على مدخلات المستخدم بدون توقف تقريبًا.
يوفر إطلاق نموذجين في نفس الوقت — GPT-Realtime-2.1 الأكثر قوة والإصدار mini الخفيف — للمطورين خيارًا بين نموذج استدلال أكثر قوة وخيار أكثر بأسعار معقولة للسيناريوهات حيث تكون السرعة والتكلفة أكثر أهمية من عمق الاستدلال في كل رد.
- نموذجان جديدان: GPT-Realtime-2.1 و GPT-Realtime-2.1-mini
- GPT-Realtime-2.1-mini — نموذج استدلال مدمج للصوت
- سعر الإصدار mini قابل للمقارنة مع gpt-realtime-mini السابق
- زمن استجابة p95 منخفض بنسبة 25% على الأقل من خلال تخزين مؤقت محسّن
- الاتصال بالنماذج — عبر بروتوكول WebRTC
لماذا يهم زمن الاستجابة p95
بالنسبة لوكلاء الصوت الذين يجب أن يردوا على المستخدمين في الوقت الفعلي، فإن زمن التأخير هو أحد مؤشرات الجودة الرئيسية: كلما زاد، كلما كانت المحادثة تبدو ميكانيكية وغير طبيعية. تُظهر مقياس p95 زمن التأخير الذي لا يتم تجاوزه بنسبة 95% من الطلبات، مما يعني أنه يعكس سلوك النظام ليس في أفضل حالة بل في الحالة النموذجية والقريبة من أسوأ حالة. يعني انخفاض هذا المقياس بنسبة 25% على الأقل من خلال تخزين مؤقت محسّن أن الغالبية العظمى من ردود الصوت التي يقدمها النظام الآن أسرع بكثير مما كانت عليه من قبل، دون تغيير نموذج الاستدلال نفسه.
كيفية الاتصال بالنماذج الجديدة
حافظت OpenAI لمجموعة Realtime على الاتصال عبر بروتوكول WebRTC — نفس الطريقة المستخدمة للإصدارات السابقة. يسمح هذا للمطورين الذين دمجوا بالفعل وكلاء صوت بناءً على API Realtime بالتبديل إلى النماذج الجديدة دون تغيير بروتوكول النقل.
ما يعنيه هذا
تُظهر تحديثات مجموعة Realtime أن OpenAI تستمر في إجراء تحسينات مستهدفة على البنية التحتية لوكيل الصوت — مما يقلل زمن التأخير ويجعل نماذج الاستدلال للصوت أكثر بأسعار معقولة، بدلاً من مجرد إطلاق إصدارات أكثر قوة ولكن أيضًا أكثر تكلفة.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.