MarkTechPost→ original

Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели

Black Forest Labs выпустила FLUX 3 — мультимодальную flow-модель, обученную сразу на изображениях, видео и звуке. Из одного набора весов она генерирует картинки, видео до 20 секунд с нативным аудио и предсказывает действия робота. В тесте на человеческих предпочтениях FLUX 3 обошла Luma Ray 3.2 в 93% сравнений и Runway Gen-4.5 в 77%. Тот же backbone управляет роботом быстрее 80 мс на одной RTX 5090.

Procesado por IA desde MarkTechPost; editado por Hamidun News
Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели
Fuente: MarkTechPost. Collage: Hamidun News.
◐ Escuchar artículo

Black Forest Labs lanzó FLUX 3 el 26 de julio de 2026 — un modelo flow multimodal que, a partir de un único conjunto de pesos, genera imágenes, video de hasta 20 segundos con sonido nativo, audio y predice las acciones de un robot. Es el primer modelo de la familia FLUX en el que el video, el sonido y la predicción de acciones surgen de una arquitectura compartida.

Qué puede hacer FLUX 3 Video

FLUX 3 Video crea clips de hasta 20 segundos de duración en una sola generación, con sonido incluido desde el principio. Según Black Forest Labs, el modelo admite cinco modos: text-to-video, image-to-video, video-to-video con referencia, keyframe-to-video para transiciones controladas y la continuación de video-audio a partir de un clip de entrada.

La compañía también destaca los diálogos multilingües, el ensamblaje de varios clips en una única secuencia multiescena y la generación de tipografía animada. El equipo de BFL afirma haber logrado una fuerte elaboración de las expresiones faciales humanas y una vinculación precisa del sonido con los eventos físicos: un golpe en pantalla coincide con el sonido del impacto.

  • Lanzamiento — 26 de julio de 2026
  • Video de hasta 20 segundos con sonido nativo en una sola generación
  • Cinco modos: text/image/video/keyframe-to-video y continuación video-audio
  • FLUX-mimic: la política del robot funciona en menos de 80 ms en una sola RTX 5090
  • El acceso es escalonado: Video y Action tienen acceso anticipado, Image llegará después, y los open weights se publicarán en último lugar

Cómo está construido el modelo

FLUX 3 está construido sobre el método Self-Flow, un enfoque de Black Forest Labs que combina flow matching con reconstrucción de características autosupervisada en una sola arquitectura. La propia Self-Flow fue presentada por la compañía en marzo de 2026; lo nuevo aquí es la escala: según BFL, el cómputo y el volumen de datos se "incrementaron significativamente", entrenando el modelo en video, imágenes y sonido simultáneamente.

La distribución de recursos es desigual: según Black Forest Labs, la predicción de video consume más del 95% del cómputo de entrenamiento, mientras que el audio representa menos del 0,5% de los tokens. La idea es que las modalidades se limitan entre sí durante el entrenamiento.

«Ninguna modalidad por sí sola ofrece una descripción completa del mundo», formula así su principio el equipo de investigación de

Black Forest Labs.

Cuánto supera FLUX 3 a la competencia

En una prueba preliminar de preferencia humana, FLUX 3 superó a la mayoría de sus rivales. Se compararon clips de text-to-video de 10 segundos en 720p con sonido.

  • Luma Ray 3.2 — FLUX 3 fue preferido en el 93% de las comparaciones
  • Runway Gen-4.5 — en el 77%
  • Grok Imagine Video — hasta el 69%, Kling v3 Pro — 60%
  • Seedance 2.0 y Gemini Omni Flash — 52%, casi como lanzar una moneda al aire

El mismo backbone impulsa FLUX-mimic, una política de robot que, según BFL, funciona en menos de 80 ms en una sola RTX 5090. Esto demuestra que el modelo multimodal es aplicable no solo a la generación de medios, sino también al control de acciones físicas.

Qué significa esto

FLUX 3 es una apuesta por un modelo foundation unificado, donde la generación de imágenes, el video con sonido y el control de robots crecen a partir de pesos compartidos. El acceso todavía es limitado: Video y Action están abiertos en acceso anticipado, Image llegará más adelante, y Black Forest Labs promete publicar los open weights en último lugar.

Preguntas frecuentes

¿Qué es FLUX 3?

FLUX 3 es el modelo flow multimodal de Black Forest Labs, entrenado simultáneamente en imágenes, video y sonido. A partir de un único conjunto de pesos genera imágenes, video de hasta 20 segundos con audio nativo y predice las acciones de un robot.

¿Cuándo se publicarán los open weights de FLUX 3?

No hay una fecha exacta todavía. El acceso avanza por etapas: primero Video y Action en acceso anticipado, luego Image, mientras que Black Forest Labs planea publicar los open weights en último lugar.

¿Con qué funciona el robot basado en FLUX 3?

Con FLUX-mimic, una política de robot sobre el mismo backbone. Según Black Forest Labs, funciona en menos de 80 ms en una sola tarjeta gráfica NVIDIA RTX 5090.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…