Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели
Black Forest Labs выпустила FLUX 3 — мультимодальную flow-модель, обученную сразу на изображениях, видео и звуке. Из одного набора весов она генерирует картинки, видео до 20 секунд с нативным аудио и предсказывает действия робота. В тесте на человеческих предпочтениях FLUX 3 обошла Luma Ray 3.2 в 93% сравнений и Runway Gen-4.5 в 77%. Тот же backbone управляет роботом быстрее 80 мс на одной RTX 5090.
AI-обработка оригинала MarkTechPost; редакция Hamidun News
Black Forest Labs 26 июля 2026 года выпустила FLUX 3 — мультимодальную flow-модель, которая из одного набора весов генерирует изображения, видео до 20 секунд с нативным звуком, аудио и предсказывает действия робота. Это первая модель семейства FLUX, где видео, звук и предсказание действий выходят из общей архитектуры.
Что умеет FLUX 3 Video
FLUX 3 Video создаёт клипы длиной до 20 секунд за одну генерацию, сразу со звуком. По данным Black Forest Labs, модель поддерживает пять режимов: text-to-video, image-to-video, video-to-video по референсу, keyframe-to-video для управляемых переходов и продолжение видео-аудио из входного клипа.
Компания отдельно отмечает многоязычные диалоги, сборку нескольких клипов в единую многосценовую последовательность и генерацию анимированной типографики. Команда BFL заявляет о сильной проработке мимики человека и точной привязке звука к физическим событиям — удар в кадре совпадает со звуком удара.
- Релиз — 26 июля 2026 года
- Видео до 20 секунд с нативным звуком за одну генерацию
- Пять режимов: text/image/video/keyframe-to-video и видео-аудио продолжение
- FLUX-mimic: политика робота работает быстрее 80 мс на одной RTX 5090
- Доступ поэтапный: Video и Action — early access, Image позже, open weights последними
Как устроена модель
FLUX 3 построена на методе Self-Flow — подходе Black Forest Labs, который совмещает flow matching с самоконтролируемой реконструкцией признаков в одной архитектуре. Сам Self-Flow компания представила ещё в марте 2026 года; новое здесь — масштаб: по словам BFL, вычисления и объём данных «значительно нарастили», обучив модель на видео, изображениях и звуке одновременно.
Распределение ресурсов неравномерное: по данным Black Forest Labs, на предсказание видео уходит свыше 95% обучающего compute, а на аудио — менее 0,5% токенов. Идея в том, что модальности ограничивают друг друга во время обучения.
«Ни одна отдельная модальность не даёт полного описания мира», — формулирует свой принцип исследовательская команда
Black Forest Labs.
Насколько FLUX 3 обходит конкурентов
В предварительном тесте на человеческих предпочтениях FLUX 3 обошла большинство соперников. Сравнивали 10-секундные ролики text-to-video в 720p со звуком.
- Luma Ray 3.2 — FLUX 3 предпочли в 93% сравнений
- Runway Gen-4.5 — в 77%
- Grok Imagine Video — до 69%, Kling v3 Pro — 60%
- Seedance 2.0 и Gemini Omni Flash — 52%, почти как подбрасывание монетки
Тот же backbone управляет FLUX-mimic — политикой робота, которая, по данным BFL, работает быстрее 80 мс на одной видеокарте RTX 5090. Это показывает, что мультимодальная модель применима не только к генерации медиа, но и к управлению физическими действиями.
Что это значит
FLUX 3 — заявка на единую foundation-модель, где генерация картинки, видео со звуком и управление роботом растут из общих весов. Доступ пока ограничен: Video и Action открыты в раннем доступе, Image выйдет позже, а открытые веса Black Forest Labs обещает выложить в последнюю очередь.
Частые вопросы
Что такое FLUX 3?
FLUX 3 — мультимодальная flow-модель Black Forest Labs, обученная одновременно на изображениях, видео и звуке. Из одного набора весов она генерирует изображения, видео до 20 секунд с нативным аудио и предсказывает действия робота.
Когда выложат открытые веса FLUX 3?
Точной даты нет. Доступ идёт поэтапно: сначала Video и Action в раннем доступе, затем Image, а открытые веса Black Forest Labs планирует опубликовать последними.
На чём работает робот на базе FLUX 3?
На FLUX-mimic — политике робота на том же backbone. По данным Black Forest Labs, она отрабатывает быстрее 80 мс на одной видеокарте NVIDIA RTX 5090.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.