Habr AI→ المصدر

Veo 3.1 وKling وSora 2 وGrok: اختبار خمسة مولدات فيديو بالـ AI باستخدام الموجّهات نفسها

قارن كتّاب Habr بين خمسة من أبرز مولدات الفيديو بالـ AI — Veo 3.1 وKling v3 Omni وSora 2 Pro وLTX-2.3 Pro وGrok Imagine Video 1.5 — عبر سبعة سيناريوهات متطابقة: فارس من العصور الوسطى، ولاعب خفة، وقط مذعور، وويل سميث مع سباغيتي. الموجّهات نفسها، والإعدادات نفسها، وظروف متكافئة — اختبار ضغط نزيه في منتصف 2026.

معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
Veo 3.1 وKling وSora 2 وGrok: اختبار خمسة مولدات فيديو بالـ AI باستخدام الموجّهات نفسها
المصدر: Habr AI. كولاج: Hamidun News.
◐ استمع للمقال

اختبر مؤلفو موقع Habr خمس شبكات عصبية رائدة لمقاطع الفيديو - Veo 3.1 و Kling v3 Omni و Sora 2 Pro و LTX-2.3 Pro و Grok Imagine Video 1.5 - حيث قاموا بتشغيل كل منها عبر سبعة سيناريوهات متطابقة بنفس المحفزات والإعدادات.

ما تم تضمينه في الاختبار

شاركت خمس أدوات من نظم بيئية مختلفة في المقارنة:

  • Veo 3.1 — أحدث نموذج فيديو من Google DeepMind، الجيل الثالث من السلسلة
  • Kling v3 Omni — المنتج الرائد لاستوديو Kuaishou الصيني
  • Sora 2 Pro — منشئ الفيديو المتقدم من OpenAI، يطور Sora الأصلي من عام 2024
  • LTX-2.3 Pro — حل مفتوح المصدر من Lightricks، بديل ملحوظ للنماذج المغلقة
  • Grok Imagine Video 1.5 — نموذج فيديو من النظام البيئي xAI، المدمج في منصة Grok

يغطي الاختيار قطاعات سوق مختلفة: مختبرات الذكاء الاصطناعي الأمريكية والاستوديوهات الصينية ومفتوح المصدر - دون انحياز نحو لاعب واحد.

كيفية عمل المنهجية

المبدأ الأساسي للاختبار هو القابلية الصارمة للتكرار. تلقت كل نموذج نفس المحفز مع معاملات متطابقة: الدقة والمدة وإعدادات الإنشاء الأساسية. سبعة سيناريوهات ذات تعقيد متزايد.

من بينها كان هناك فارس العصور الوسطى في الحركة وعازف الألعاب البهلوانية مع الدعائم وقطة في حالة ذعر وكذلك اختبار الضغط الكلاسيكي - Will Smith يأكل المعكرونة بنهم. أصبح السيناريو الأخير ميمًا في مجتمع الذكاء الاصطناعي: كانت النماذج المبكرة تنتج نتائج فاشلة بوضوح هنا مع أيد مشوهة وفيزياء غير طبيعية.

تغطي المجموعة بشكل محدد النقاط الضعيفة تاريخياً في الفيديو التوليدي: فيزياء حركة الأيدي والأصابع والتعبيرات الوجهية والتفاعل مع الكائنات والواقعية المكانية.

لماذا المقارنة ذات صلة الآن

في عام 2024، كان فيديو الذكاء الاصطناعي يمكن التعرف عليه بسهولة من خلال القطع الأثرية المميزة - الوجوه الطافية والأصابع الإضافية والحركات المتقطعة. على مدى السنة والنصف الماضية، انتقل السوق من الفضول إلى الأدوات المستخدمة فعلاً في التسويق والسينما والإعلانات.

"في السنوات السابقة، كان فيديو الشبكة العصبية ملحوظاً بسبب عيوبه

المميزة. كيف تسير الأمور في منتصف عام 2026؟" — يصيغ المؤلفون السؤال المركزي للاختبار.

اليوم، يواجه المستخدم تحدياً مختلفاً: ليس "التمييز عن الحقيقي" بل "اختيار الأداة المناسبة من بين عشرات المتاحة". كل نموذج يروج لمعاييره ومقاطع الفيديو التسويقية الخاصة به — يظل الاختبار المستقل في ظروف متساوية نادراً.

ما يعنيه هذا

المقارنة باستخدام محفزات موحدة هي أحد أكثر الصيغ صراحة للتقييم: لا تؤخذ المطالبات التسويقية للمصنعين في الحسبان. النتائج مفيدة لأولئك الذين يختارون أداة لمهام محددة - مقاطع فيديو تسويقية وأنماط من المشاهد البصرية ومحتوى الشبكات الاجتماعية. لقد ترك سوق فيديو الذكاء الاصطناعي بشكل نهائي مرحلة العرض التوضيحي - الآن هو خيار عملي برهانات حقيقية.

ما هي الشبكات العصبية لمقاطع الفيديو التي تم اختبارها؟

Veo 3.1 (Google DeepMind)، Kling v3 Omni (Kuaishou)، Sora 2 Pro (OpenAI)، LTX-2.3 Pro و Grok Imagine Video 1.5.

ما هي أفضل شبكة عصبية لمقاطع الفيديو؟

في اختبار Habr، تمت مقارنة خمس أدوات: Veo 3.1 (Google DeepMind)، Kling v3 Omni (Kuaishou)، Sora 2 Pro (OpenAI)، LTX-2.3 Pro و Grok Imagine Video 1.5. مرت كل نموذج عبر سبعة سيناريوهات متطابقة للمقارنة الموضوعية.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…