MarkTechPost→ المصدر

Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели

Black Forest Labs выпустила FLUX 3 — мультимодальную flow-модель, обученную сразу на изображениях, видео и звуке. Из одного набора весов она генерирует картинки, видео до 20 секунд с нативным аудио и предсказывает действия робота. В тесте на человеческих предпочтениях FLUX 3 обошла Luma Ray 3.2 в 93% сравнений и Runway Gen-4.5 в 77%. Тот же backbone управляет роботом быстрее 80 мс на одной RTX 5090.

معالج بواسطة الذكاء الاصطناعي من MarkTechPost؛ بتحرير Hamidun News
Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели
المصدر: MarkTechPost. كولاج: Hamidun News.
◐ استمع للمقال

أطلقت Black Forest Labs في 26 يوليو 2026 نموذج FLUX 3 — نموذج تدفق (flow) متعدد الوسائط يقوم، انطلاقًا من مجموعة أوزان واحدة، بتوليد الصور ومقاطع فيديو تصل مدتها إلى 20 ثانية بصوت أصلي (native)، وصوت مستقل، والتنبؤ بحركات روبوت. وهذا أول نموذج في عائلة FLUX تنبثق فيه معالجة الفيديو والصوت والتنبؤ بالحركات من بنية معمارية واحدة مشتركة.

ما الذي يستطيع FLUX 3 Video فعله

يُنشئ FLUX 3 Video مقاطع فيديو تصل مدتها إلى 20 ثانية في عملية توليد واحدة، مع الصوت منذ البداية. ووفقًا لـ Black Forest Labs، يدعم النموذج خمسة أوضاع: text-to-video، وimage-to-video، وvideo-to-video بالاستناد إلى مرجع، وkeyframe-to-video للانتقالات المُتحكَّم بها، واستكمال الفيديو والصوت انطلاقًا من مقطع مُدخَل.

وتشير الشركة أيضًا إلى الحوارات متعددة اللغات، وتجميع عدة مقاطع في تسلسل واحد متعدد المشاهد، وتوليد خط مطبعي متحرك (typography). ويؤكد فريق BFL أنه حقق تطويرًا قويًا في تعابير وجه الإنسان وربطًا دقيقًا بين الصوت والأحداث الفيزيائية — فارتطام يظهر على الشاشة يتزامن مع صوت الاصطدام.

  • الإطلاق — 26 يوليو 2026
  • فيديو تصل مدته إلى 20 ثانية بصوت أصلي في عملية توليد واحدة
  • خمسة أوضاع: text/image/video/keyframe-to-video واستكمال فيديو-صوت
  • FLUX-mimic: سياسة الروبوت تعمل بسرعة تفوق 80 مللي ثانية على بطاقة RTX 5090 واحدة
  • الإتاحة تدريجية: Video وAction بوصول مبكر (early access)، وImage لاحقًا، والأوزان المفتوحة (open weights) في الأخير

كيف بُني النموذج

بُني FLUX 3 على طريقة Self-Flow — وهي منهجية من Black Forest Labs تجمع بين مطابقة التدفق (flow matching) وإعادة بناء السمات ذاتيّ الإشراف ضمن بنية معمارية واحدة. وكانت الشركة قد قدّمت Self-Flow نفسها في مارس 2026؛ والجديد هنا هو الحجم: فبحسب BFL، تم توسيع الحوسبة وحجم البيانات "بشكل كبير"، إذ دُرِّب النموذج على الفيديو والصور والصوت في آن واحد.

وتوزيع الموارد غير متكافئ: فوفقًا لـ Black Forest Labs، يستهلك التنبؤ بالفيديو أكثر من 95% من حوسبة التدريب، بينما لا يتجاوز نصيب الصوت 0.5% من الرموز (tokens). والفكرة أن كل وسيلة (modality) تحدّ من الأخرى أثناء التدريب.

«لا توجد وسيلة واحدة بمفردها تقدّم وصفًا كاملًا للعالم» — هكذا يصوغ فريق البحث في

Black Forest Labs مبدأه.

إلى أي مدى يتفوق FLUX 3 على المنافسين

في اختبار أولي لتفضيلات البشر، تفوّق FLUX 3 على معظم منافسيه. وقد جرت المقارنة على مقاطع text-to-video مدتها 10 ثوانٍ بدقة 720p مع الصوت.

  • Luma Ray 3.2 — فُضِّل FLUX 3 في 93% من المقارنات
  • Runway Gen-4.5 — في 77%
  • Grok Imagine Video — حتى 69%، وKling v3 Pro — 60%
  • Seedance 2.0 وGemini Omni Flash — 52%، أي أقرب إلى قذف عملة معدنية

وتشغّل البنية الأساسية (backbone) نفسها FLUX-mimic — سياسة الروبوت التي تعمل، بحسب BFL، بسرعة تفوق 80 مللي ثانية على بطاقة RTX 5090 واحدة. وهذا يُظهر أن النموذج متعدد الوسائط لا يصلح فقط لتوليد الوسائط، بل أيضًا للتحكم في الأفعال الفيزيائية.

ماذا يعني ذلك

يمثّل FLUX 3 مراهنة على نموذج أساس (foundation) موحّد، حيث ينمو توليد الصور والفيديو المصحوب بالصوت والتحكم في الروبوتات من أوزان مشتركة. والوصول لا يزال محدودًا: Video وAction متاحان بوصول مبكر، وImage سيصدر لاحقًا، فيما تعد Black Forest Labs بنشر الأوزان المفتوحة (open weights) في الأخير.

الأسئلة الشائعة

ما هو FLUX 3؟

FLUX 3 هو نموذج التدفق (flow) متعدد الوسائط من Black Forest Labs، مُدرَّب في آن واحد على الصور والفيديو والصوت. وهو يولّد، انطلاقًا من مجموعة أوزان واحدة، صورًا ومقاطع فيديو تصل مدتها إلى 20 ثانية بصوت أصلي، ويتنبأ بحركات روبوت.

متى ستصدر الأوزان المفتوحة لـ FLUX 3؟

لا يوجد تاريخ دقيق حتى الآن. يتم طرح الوصول على مراحل: أولًا Video وAction بوصول مبكر، ثم Image، في حين تخطط Black Forest Labs لنشر الأوزان المفتوحة في الأخير.

على ماذا يعمل الروبوت المبني على FLUX 3؟

على FLUX-mimic — وهي سياسة روبوت تعمل على البنية الأساسية نفسها. وبحسب Black Forest Labs، فهي تعمل بسرعة تفوق 80 مللي ثانية على بطاقة رسومات NVIDIA RTX 5090 واحدة.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…