Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели
Black Forest Labs выпустила FLUX 3 — мультимодальную flow-модель, обученную сразу на изображениях, видео и звуке. Из одного набора весов она генерирует картинки, видео до 20 секунд с нативным аудио и предсказывает действия робота. В тесте на человеческих предпочтениях FLUX 3 обошла Luma Ray 3.2 в 93% сравнений и Runway Gen-4.5 в 77%. Тот же backbone управляет роботом быстрее 80 мс на одной RTX 5090.
Traité par IA depuis MarkTechPost ; édité par Hamidun News
Black Forest Labs a lancé FLUX 3 le 26 juillet 2026 — un modèle flow multimodal qui, à partir d'un seul jeu de poids, génère des images, des vidéos allant jusqu'à 20 secondes avec un son natif, de l'audio, et prédit les actions d'un robot. C'est le premier modèle de la famille FLUX dans lequel la vidéo, le son et la prédiction d'actions émergent d'une architecture commune.
Ce que sait faire FLUX 3 Video
FLUX 3 Video crée des clips allant jusqu'à 20 secondes en une seule génération, avec le son inclus dès le départ. Selon Black Forest Labs, le modèle prend en charge cinq modes : text-to-video, image-to-video, video-to-video par référence, keyframe-to-video pour des transitions contrôlées, et la continuation vidéo-audio à partir d'un clip d'entrée.
L'entreprise met aussi en avant les dialogues multilingues, l'assemblage de plusieurs clips en une seule séquence multi-scènes et la génération de typographie animée. L'équipe de BFL affirme avoir fortement travaillé les expressions faciales humaines et une synchronisation précise du son avec les événements physiques — un impact à l'écran coïncide avec le bruit du choc.
- Sortie — 26 juillet 2026
- Vidéo jusqu'à 20 secondes avec son natif en une seule génération
- Cinq modes : text/image/video/keyframe-to-video et continuation vidéo-audio
- FLUX-mimic : la politique du robot tourne en moins de 80 ms sur une seule RTX 5090
- Le déploiement est progressif : Video et Action sont en accès anticipé, Image arrivera plus tard, et les open weights seront publiés en dernier
Comment le modèle est construit
FLUX 3 repose sur la méthode Self-Flow — une approche de Black Forest Labs qui combine le flow matching avec une reconstruction de caractéristiques auto-supervisée au sein d'une seule architecture. Self-Flow elle-même avait déjà été présentée par l'entreprise en mars 2026 ; ce qui est nouveau ici, c'est l'échelle : selon BFL, le calcul et le volume de données ont été « considérablement augmentés », en entraînant le modèle simultanément sur la vidéo, les images et le son.
La répartition des ressources est inégale : selon Black Forest Labs, la prédiction vidéo consomme plus de 95 % du compute d'entraînement, tandis que l'audio représente moins de 0,5 % des tokens. L'idée est que les modalités se limitent mutuellement pendant l'entraînement.
«
Aucune modalité prise isolément ne donne une description complète du monde », résume ainsi son principe l'équipe de recherche de Black Forest Labs.
Dans quelle mesure FLUX 3 devance ses concurrents
Dans un test préliminaire de préférence humaine, FLUX 3 a devancé la plupart de ses rivaux. La comparaison portait sur des clips text-to-video de 10 secondes en 720p avec son.
- Luma Ray 3.2 — FLUX 3 a été préféré dans 93 % des comparaisons
- Runway Gen-4.5 — dans 77 %
- Grok Imagine Video — jusqu'à 69 %, Kling v3 Pro — 60 %
- Seedance 2.0 et Gemini Omni Flash — 52 %, presque comme à pile ou face
Le même backbone fait tourner FLUX-mimic — une politique de robot qui, selon BFL, s'exécute en moins de 80 ms sur une seule RTX 5090. Cela montre que le modèle multimodal ne s'applique pas seulement à la génération de médias, mais aussi au contrôle d'actions physiques.
Ce que cela signifie
FLUX 3 est un pari sur un modèle foundation unifié, où la génération d'images, la vidéo avec son et le contrôle de robots se développent à partir de poids communs. L'accès reste pour l'instant limité : Video et Action sont ouverts en accès anticipé, Image arrivera plus tard, et Black Forest Labs promet de publier les open weights en dernier.
Questions fréquentes
Qu'est-ce que FLUX 3 ?
FLUX 3 est le modèle flow multimodal de Black Forest Labs, entraîné simultanément sur des images, des vidéos et du son. À partir d'un seul jeu de poids, il génère des images, des vidéos jusqu'à 20 secondes avec de l'audio natif, et prédit les actions d'un robot.
Quand les open weights de FLUX 3 seront-ils publiés ?
Il n'y a pas de date précise pour l'instant. L'accès se déploie par étapes : d'abord Video et Action en accès anticipé, puis Image, tandis que Black Forest Labs prévoit de publier les open weights en dernier.
Sur quoi fonctionne le robot basé sur FLUX 3 ?
Sur FLUX-mimic — une politique de robot reposant sur le même backbone. Selon Black Forest Labs, elle s'exécute en moins de 80 ms sur une seule carte graphique NVIDIA RTX 5090.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.