Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели
Black Forest Labs выпустила FLUX 3 — мультимодальную flow-модель, обученную сразу на изображениях, видео и звуке. Из одного набора весов она генерирует картинки, видео до 20 секунд с нативным аудио и предсказывает действия робота. В тесте на человеческих предпочтениях FLUX 3 обошла Luma Ray 3.2 в 93% сравнений и Runway Gen-4.5 в 77%. Тот же backbone управляет роботом быстрее 80 мс на одной RTX 5090.
Procesado por IA desde MarkTechPost; editado por Hamidun News
Black Forest Labs lanzó FLUX 3 el 26 de julio de 2026 — un modelo flow multimodal que, a partir de un único conjunto de pesos, genera imágenes, video de hasta 20 segundos con sonido nativo, audio y predice las acciones de un robot. Es el primer modelo de la familia FLUX en el que el video, el sonido y la predicción de acciones surgen de una arquitectura compartida.
Qué puede hacer FLUX 3 Video
FLUX 3 Video crea clips de hasta 20 segundos de duración en una sola generación, con sonido incluido desde el principio. Según Black Forest Labs, el modelo admite cinco modos: text-to-video, image-to-video, video-to-video con referencia, keyframe-to-video para transiciones controladas y la continuación de video-audio a partir de un clip de entrada.
La compañía también destaca los diálogos multilingües, el ensamblaje de varios clips en una única secuencia multiescena y la generación de tipografía animada. El equipo de BFL afirma haber logrado una fuerte elaboración de las expresiones faciales humanas y una vinculación precisa del sonido con los eventos físicos: un golpe en pantalla coincide con el sonido del impacto.
- Lanzamiento — 26 de julio de 2026
- Video de hasta 20 segundos con sonido nativo en una sola generación
- Cinco modos: text/image/video/keyframe-to-video y continuación video-audio
- FLUX-mimic: la política del robot funciona en menos de 80 ms en una sola RTX 5090
- El acceso es escalonado: Video y Action tienen acceso anticipado, Image llegará después, y los open weights se publicarán en último lugar
Cómo está construido el modelo
FLUX 3 está construido sobre el método Self-Flow, un enfoque de Black Forest Labs que combina flow matching con reconstrucción de características autosupervisada en una sola arquitectura. La propia Self-Flow fue presentada por la compañía en marzo de 2026; lo nuevo aquí es la escala: según BFL, el cómputo y el volumen de datos se "incrementaron significativamente", entrenando el modelo en video, imágenes y sonido simultáneamente.
La distribución de recursos es desigual: según Black Forest Labs, la predicción de video consume más del 95% del cómputo de entrenamiento, mientras que el audio representa menos del 0,5% de los tokens. La idea es que las modalidades se limitan entre sí durante el entrenamiento.
«Ninguna modalidad por sí sola ofrece una descripción completa del mundo», formula así su principio el equipo de investigación de
Black Forest Labs.
Cuánto supera FLUX 3 a la competencia
En una prueba preliminar de preferencia humana, FLUX 3 superó a la mayoría de sus rivales. Se compararon clips de text-to-video de 10 segundos en 720p con sonido.
- Luma Ray 3.2 — FLUX 3 fue preferido en el 93% de las comparaciones
- Runway Gen-4.5 — en el 77%
- Grok Imagine Video — hasta el 69%, Kling v3 Pro — 60%
- Seedance 2.0 y Gemini Omni Flash — 52%, casi como lanzar una moneda al aire
El mismo backbone impulsa FLUX-mimic, una política de robot que, según BFL, funciona en menos de 80 ms en una sola RTX 5090. Esto demuestra que el modelo multimodal es aplicable no solo a la generación de medios, sino también al control de acciones físicas.
Qué significa esto
FLUX 3 es una apuesta por un modelo foundation unificado, donde la generación de imágenes, el video con sonido y el control de robots crecen a partir de pesos compartidos. El acceso todavía es limitado: Video y Action están abiertos en acceso anticipado, Image llegará más adelante, y Black Forest Labs promete publicar los open weights en último lugar.
Preguntas frecuentes
¿Qué es FLUX 3?
FLUX 3 es el modelo flow multimodal de Black Forest Labs, entrenado simultáneamente en imágenes, video y sonido. A partir de un único conjunto de pesos genera imágenes, video de hasta 20 segundos con audio nativo y predice las acciones de un robot.
¿Cuándo se publicarán los open weights de FLUX 3?
No hay una fecha exacta todavía. El acceso avanza por etapas: primero Video y Action en acceso anticipado, luego Image, mientras que Black Forest Labs planea publicar los open weights en último lugar.
¿Con qué funciona el robot basado en FLUX 3?
Con FLUX-mimic, una política de robot sobre el mismo backbone. Según Black Forest Labs, funciona en menos de 80 ms en una sola tarjeta gráfica NVIDIA RTX 5090.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.