MarkTechPost→ original

Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели

Black Forest Labs выпустила FLUX 3 — мультимодальную flow-модель, обученную сразу на изображениях, видео и звуке. Из одного набора весов она генерирует картинки, видео до 20 секунд с нативным аудио и предсказывает действия робота. В тесте на человеческих предпочтениях FLUX 3 обошла Luma Ray 3.2 в 93% сравнений и Runway Gen-4.5 в 77%. Тот же backbone управляет роботом быстрее 80 мс на одной RTX 5090.

Processado por IA de MarkTechPost; editado por Hamidun News
Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

A Black Forest Labs lançou o FLUX 3 em 26 de julho de 2026 — um modelo flow multimodal que, a partir de um único conjunto de pesos, gera imagens, vídeos de até 20 segundos com som nativo, áudio e prevê ações de um robô. Este é o primeiro modelo da família FLUX em que vídeo, som e previsão de ações emergem de uma arquitetura compartilhada.

O que o FLUX 3 Video sabe fazer

O FLUX 3 Video cria clipes de até 20 segundos de duração em uma única geração, já com som. Segundo a Black Forest Labs, o modelo suporta cinco modos: text-to-video, image-to-video, video-to-video por referência, keyframe-to-video para transições controladas e continuação de vídeo-áudio a partir de um clipe de entrada.

A empresa também destaca os diálogos multilíngues, a montagem de vários clipes em uma única sequência multicena e a geração de tipografia animada. A equipe da BFL afirma ter alcançado um forte refinamento das expressões faciais humanas e uma vinculação precisa do som a eventos físicos — um impacto na cena coincide com o som do golpe.

  • Lançamento — 26 de julho de 2026
  • Vídeo de até 20 segundos com som nativo em uma única geração
  • Cinco modos: text/image/video/keyframe-to-video e continuação vídeo-áudio
  • FLUX-mimic: a política do robô roda em menos de 80 ms em uma única RTX 5090
  • O acesso é escalonado: Video e Action têm acesso antecipado, Image chega depois, e os open weights serão os últimos a ser publicados

Como o modelo é construído

O FLUX 3 é construído sobre o método Self-Flow — uma abordagem da Black Forest Labs que combina flow matching com reconstrução de características autossupervisionada em uma única arquitetura. A própria Self-Flow foi apresentada pela empresa em março de 2026; o novo aqui é a escala: segundo a BFL, o poder de computação e o volume de dados foram "significativamente ampliados", treinando o modelo em vídeo, imagens e som simultaneamente.

A distribuição de recursos é desigual: segundo a Black Forest Labs, a previsão de vídeo consome mais de 95% do compute de treinamento, enquanto o áudio responde por menos de 0,5% dos tokens. A ideia é que as modalidades se limitam mutuamente durante o treinamento.

"Nenhuma modalidade isolada oferece uma descrição completa do mundo", formula assim seu princípio a equipe de pesquisa da

Black Forest Labs.

O quanto o FLUX 3 supera os concorrentes

Em um teste preliminar de preferência humana, o FLUX 3 superou a maioria dos concorrentes. Foram comparados clipes text-to-video de 10 segundos em 720p com som.

  • Luma Ray 3.2 — o FLUX 3 foi preferido em 93% das comparações
  • Runway Gen-4.5 — em 77%
  • Grok Imagine Video — até 69%, Kling v3 Pro — 60%
  • Seedance 2.0 e Gemini Omni Flash — 52%, quase um cara ou coroa

O mesmo backbone move o FLUX-mimic — uma política de robô que, segundo a BFL, roda em menos de 80 ms em uma única placa de vídeo RTX 5090. Isso mostra que o modelo multimodal se aplica não só à geração de mídia, mas também ao controle de ações físicas.

O que isso significa

O FLUX 3 é uma aposta em um modelo foundation unificado, no qual a geração de imagens, o vídeo com som e o controle de robôs crescem a partir de pesos compartilhados. O acesso ainda é limitado: Video e Action estão abertos em acesso antecipado, Image chega mais tarde, e a Black Forest Labs promete publicar os open weights por último.

Perguntas frequentes

O que é o FLUX 3?

O FLUX 3 é o modelo flow multimodal da Black Forest Labs, treinado simultaneamente em imagens, vídeo e som. A partir de um único conjunto de pesos, ele gera imagens, vídeos de até 20 segundos com áudio nativo e prevê ações de um robô.

Quando os open weights do FLUX 3 serão publicados?

Ainda não há data exata. O acesso está sendo liberado por etapas: primeiro Video e Action em acesso antecipado, depois Image, enquanto a Black Forest Labs planeja publicar os open weights por último.

Com que o robô baseado no FLUX 3 funciona?

Com o FLUX-mimic — uma política de robô sobre o mesmo backbone. Segundo a Black Forest Labs, ela roda em menos de 80 ms em uma única placa de vídeo NVIDIA RTX 5090.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…