MarkTechPost→ оригинал

Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели

Black Forest Labs выпустила FLUX 3 — мультимодальную flow-модель, обученную сразу на изображениях, видео и звуке. Из одного набора весов она генерирует картинки, видео до 20 секунд с нативным аудио и предсказывает действия робота. В тесте на человеческих предпочтениях FLUX 3 обошла Luma Ray 3.2 в 93% сравнений и Runway Gen-4.5 в 77%. Тот же backbone управляет роботом быстрее 80 мс на одной RTX 5090.

AI-обработка оригинала MarkTechPost; редакция Hamidun News
Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели
Источник: MarkTechPost. Коллаж: Hamidun News.
◐ Слушать статью

Black Forest Labs 26 июля 2026 года выпустила FLUX 3 — мультимодальную flow-модель, которая из одного набора весов генерирует изображения, видео до 20 секунд с нативным звуком, аудио и предсказывает действия робота. Это первая модель семейства FLUX, где видео, звук и предсказание действий выходят из общей архитектуры.

Что умеет FLUX 3 Video

FLUX 3 Video создаёт клипы длиной до 20 секунд за одну генерацию, сразу со звуком. По данным Black Forest Labs, модель поддерживает пять режимов: text-to-video, image-to-video, video-to-video по референсу, keyframe-to-video для управляемых переходов и продолжение видео-аудио из входного клипа.

Компания отдельно отмечает многоязычные диалоги, сборку нескольких клипов в единую многосценовую последовательность и генерацию анимированной типографики. Команда BFL заявляет о сильной проработке мимики человека и точной привязке звука к физическим событиям — удар в кадре совпадает со звуком удара.

  • Релиз — 26 июля 2026 года
  • Видео до 20 секунд с нативным звуком за одну генерацию
  • Пять режимов: text/image/video/keyframe-to-video и видео-аудио продолжение
  • FLUX-mimic: политика робота работает быстрее 80 мс на одной RTX 5090
  • Доступ поэтапный: Video и Action — early access, Image позже, open weights последними

Как устроена модель

FLUX 3 построена на методе Self-Flow — подходе Black Forest Labs, который совмещает flow matching с самоконтролируемой реконструкцией признаков в одной архитектуре. Сам Self-Flow компания представила ещё в марте 2026 года; новое здесь — масштаб: по словам BFL, вычисления и объём данных «значительно нарастили», обучив модель на видео, изображениях и звуке одновременно.

Распределение ресурсов неравномерное: по данным Black Forest Labs, на предсказание видео уходит свыше 95% обучающего compute, а на аудио — менее 0,5% токенов. Идея в том, что модальности ограничивают друг друга во время обучения.

«Ни одна отдельная модальность не даёт полного описания мира», — формулирует свой принцип исследовательская команда

Black Forest Labs.

Насколько FLUX 3 обходит конкурентов

В предварительном тесте на человеческих предпочтениях FLUX 3 обошла большинство соперников. Сравнивали 10-секундные ролики text-to-video в 720p со звуком.

  • Luma Ray 3.2 — FLUX 3 предпочли в 93% сравнений
  • Runway Gen-4.5 — в 77%
  • Grok Imagine Video — до 69%, Kling v3 Pro — 60%
  • Seedance 2.0 и Gemini Omni Flash — 52%, почти как подбрасывание монетки

Тот же backbone управляет FLUX-mimic — политикой робота, которая, по данным BFL, работает быстрее 80 мс на одной видеокарте RTX 5090. Это показывает, что мультимодальная модель применима не только к генерации медиа, но и к управлению физическими действиями.

Что это значит

FLUX 3 — заявка на единую foundation-модель, где генерация картинки, видео со звуком и управление роботом растут из общих весов. Доступ пока ограничен: Video и Action открыты в раннем доступе, Image выйдет позже, а открытые веса Black Forest Labs обещает выложить в последнюю очередь.

Частые вопросы

Что такое FLUX 3?

FLUX 3 — мультимодальная flow-модель Black Forest Labs, обученная одновременно на изображениях, видео и звуке. Из одного набора весов она генерирует изображения, видео до 20 секунд с нативным аудио и предсказывает действия робота.

Когда выложат открытые веса FLUX 3?

Точной даты нет. Доступ идёт поэтапно: сначала Video и Action в раннем доступе, затем Image, а открытые веса Black Forest Labs планирует опубликовать последними.

На чём работает робот на базе FLUX 3?

На FLUX-mimic — политике робота на том же backbone. По данным Black Forest Labs, она отрабатывает быстрее 80 мс на одной видеокарте NVIDIA RTX 5090.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…