غوغل تطلق Gemini 3.5 Live Translate: نموذج كلام إلى كلام لـ 70+ لغة
أطلقت غوغل في 9 يونيو 2026 نموذج Gemini 3.5 Live Translate — وهو نموذج يترجم الكلام إلى كلام في الوقت الفعلي عبر 70+ لغة. يتم توليد الصوت بشكل مستمر، ويبقى بضع ثوان خلف المتحدث. تتوفر الميزة عبر Gemini Live API وGoogle Meet وتطبيق Google Translate.
معالج بواسطة الذكاء الاصطناعي من MarkTechPost؛ بتحرير Hamidun News
أطلقت Google Gemini 3.5 Live Translate: نموذج الكلام إلى الكلام لـ 70+ لغة
أطلقت Google Gemini 3.5 Live Translate — نموذج بث لترجمة صوتية متزامنة في الوقت الفعلي يدعم أكثر من 70 لغة. وفقًا لـ MarkTechPost في 9 يونيو 2026، يترجم النموذج الجديد الكلام مباشرة إلى كلام، مما يولد الصوت كتيار مستمر مع تأخير قدره بضع ثوان فقط عن المتحدث. التطوير متاح من خلال API Gemini Live، وهو أيضًا مدمج في Google Meet وتطبيق Google Translate.
كيف يعمل البث على الترجمة
على عكس أنظمة الترجمة الآلية الكلاسيكية التي تتعرف أولاً على الكلام بالكامل، وتترجم النص، وفقط بعد ذلك تركب الصوت، يعمل Gemini 3.5 Live Translate وفقًا لمبدأ البث: يعالج النموذج الصوت الوارد في أجزاء ويبدأ في إنشاء الكلام المترجم في الحال تقريبًا، بدون انتظار المتحدث لإنهاء عبارته. هذا هو السبب بالضبط في أن التأخير يتم تقليله إلى بضع ثوان فقط — كمون مشابه للترجمة الفورية الاحترافية في مؤتمر، بدلاً من الفاصل المألوف في تطبيقات المترجم التي تعالج التسجيل كاملاً.
الحقائق الرئيسية حول الإطلاق:
- يسمى النموذج Gemini 3.5 Live Translate ينتمي إلى عائلة Gemini من Google.
- يدعم ترجمة الكلام إلى أكثر من 70 لغة.
- يعمل في وضع الكلام إلى الكلام عبر البث مع تأخير قدره بضع ثوانٍ فقط عن الأصل.
- متاح من خلال API Gemini Live للمطورين من جهات خارجية.
- مدمج في Google Meet وتطبيق Google Translate.
حيث سيظهر النموذج
Google تدمج Gemini 3.5 Live Translate في عدة منتجاتها في نفس الوقت. في Google Meet، سيتمكن النموذج من توفير ترجمة المحادثة بين المشاركين في مكالمات الفيديو بلغات مختلفة عمليًا بدون تأخير، الأمر الذي يغلق فجوة طويلة الأمد في خدمات الاتصال بالفيديو — حتى الآن اعتمد معظمها على ترجمة الترجمات المكتوبة بدلاً من ترجمة صوتية مباشرة. في تطبيق Google Translate، يستبدل النموذج الجديد أو يكمل آليات الترجمة الصوتية السابقة، مما يجعل وضع المحادثة للتطبيق أكثر طبيعية للمسافرين والمفاوضات التجارية.
بشكل منفصل، النموذج مفتوح للمطورين من خلال API Gemini Live — واجهة برمجية تسمح بدمج الوظائف في الوقت الفعلي (الصوت والفيديو والنص) في تطبيقات الجهات الخارجية. هذا يعني أن ترجمة الكلام إلى الكلام ستكون قابلة للاستخدام ليس فقط من خلال منتجات Google الخاصة بها ولكن من قبل أي شركة تقوم بإنشاء مراكز اتصالات أو منصات تعليمية أو مساعدات دعم العملاء أو أنظمة للأحداث الدولية.
طريق طويل نحو الترجمة الصوتية الحية
فكرة الترجمة الآلية الصوتية المتزامنة ليست جديدة: سماعات الترجمة الصوتية والتطبيقات ذات وظيفة "دفتر العبارات" موجودة منذ سنوات، لكن تقريبًا جميعها تعاني من نفس المشكلة — فاصل ملحوظ بين الملاحظة والترجمة، مما حول الحوار الطبيعي إلى تبادل المونولوجات مع الانتظار. أضافت كل وصلة في خط الأنابيب الكلاسيكي — التعرف على الكلام وترجمة النص الآلية وتركيب الصوت — تأخيرها الخاص ومصدر أخطائها الخاص، والتناقضات بين المراحل يمكن أن تشوه النبرة والفواصل وحتى المعنى. معمارية البث التي تجمع كل هذه الخطوات في نموذج واحد هي الإجابة على هذه المشكلة بالضبط، وحقيقة أن Google تطلقها على الفور في منتجات جماهيرية مثل Meet و Translate، بدلاً من الاحتفاظ بها في حالة تجريبية، تتحدث عن استعداد الشركة لتوسيع نطاق التكنولوجيا إلى ملايين المستخدمين.
ما الذي يتغير بالنسبة للمطورين والعمل
توفر نموذج ترجمة بث يمكن الوصول إليه عبر API يقلل من حاجز الدخول للشركات التي كانت يجب عليها سابقًا إما توظيف فريق من المترجمين أو دمج خدمات منفصلة للتعرف على الكلام وترجمة النص وتركيب الصوت بشكل منفصل — مع فترات تأخير مقابلة في كل مرحلة. يبسط نموذج كلام موحد إلى كلام معمارية هذه المنتجات ويقلل احتمال الزمن الكامن والتكاليف المتراكمة.
بالنسبة لمستخدمي النهاية، التأثير الرئيسي هو جعل الترجمة الآلية أقرب إلى تجربة الترجمة الفورية الحية في السيناريوهات اليومية: مكالمات الفيديو والرحلات والمفاوضات. بالنظر إلى أن Google تطور Gemini بشكل متزامن كنظام بيئي للنماذج وتدمج قدرات جديدة في منتجاتها الجماهيرية — Meet و Translate والبحث وخدمات المكاتب — يمكن أن تصبح ترجمة الكلام عبر البث بسرعة كبيرة ميزة قياسية بدلاً من كونها قدرة متخصصة متاحة فقط من خلال خدمات الترجمة الفورية المتخصصة.
سؤال جودة الترجمة في السيناريوهات المعقدة يبقى مفتوحًا — مع الملاحظات المتداخلة من متحدثين متعددين أو ضوضاء خلفية قوية أو مصطلحات متخصصة للغاية، حيث حتى المترجمون الفوريون المحترفون يرتكبون أخطاء. التأخير قدره بضع ثوان الذي يذكره Google هو حل وسط بين السرعة والدقة: كلما قل السياق الذي يتمكن النموذج من تراكمه قبل إنشاء ترجمة، كلما زاد خطر عدم الدقة في الجمل الطويلة والمعقدة بناءً على الصيغة. ومع ذلك، فقط حقيقة أن هذه الوظيفة الآن مدمجة في الأدوات اليومية مثل Google Meet، بدلاً من الحاجة إلى معدات متخصصة منفصلة، تقلل بشكل كبير من حاجز الاتصال الدولي في الأعمال التجارية والحياة اليومية.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.