Black Forest Labs выпустила FLUX 3: видео до 20 секунд со звуком из одной модели
Black Forest Labs выпустила FLUX 3 — мультимодальную flow-модель, обученную сразу на изображениях, видео и звуке. Из одного набора весов она генерирует картинки, видео до 20 секунд с нативным аудио и предсказывает действия робота. В тесте на человеческих предпочтениях FLUX 3 обошла Luma Ray 3.2 в 93% сравнений и Runway Gen-4.5 в 77%. Тот же backbone управляет роботом быстрее 80 мс на одной RTX 5090.
Processado por IA de MarkTechPost; editado por Hamidun News
A Black Forest Labs lançou o FLUX 3 em 26 de julho de 2026 — um modelo flow multimodal que, a partir de um único conjunto de pesos, gera imagens, vídeos de até 20 segundos com som nativo, áudio e prevê ações de um robô. Este é o primeiro modelo da família FLUX em que vídeo, som e previsão de ações emergem de uma arquitetura compartilhada.
O que o FLUX 3 Video sabe fazer
O FLUX 3 Video cria clipes de até 20 segundos de duração em uma única geração, já com som. Segundo a Black Forest Labs, o modelo suporta cinco modos: text-to-video, image-to-video, video-to-video por referência, keyframe-to-video para transições controladas e continuação de vídeo-áudio a partir de um clipe de entrada.
A empresa também destaca os diálogos multilíngues, a montagem de vários clipes em uma única sequência multicena e a geração de tipografia animada. A equipe da BFL afirma ter alcançado um forte refinamento das expressões faciais humanas e uma vinculação precisa do som a eventos físicos — um impacto na cena coincide com o som do golpe.
- Lançamento — 26 de julho de 2026
- Vídeo de até 20 segundos com som nativo em uma única geração
- Cinco modos: text/image/video/keyframe-to-video e continuação vídeo-áudio
- FLUX-mimic: a política do robô roda em menos de 80 ms em uma única RTX 5090
- O acesso é escalonado: Video e Action têm acesso antecipado, Image chega depois, e os open weights serão os últimos a ser publicados
Como o modelo é construído
O FLUX 3 é construído sobre o método Self-Flow — uma abordagem da Black Forest Labs que combina flow matching com reconstrução de características autossupervisionada em uma única arquitetura. A própria Self-Flow foi apresentada pela empresa em março de 2026; o novo aqui é a escala: segundo a BFL, o poder de computação e o volume de dados foram "significativamente ampliados", treinando o modelo em vídeo, imagens e som simultaneamente.
A distribuição de recursos é desigual: segundo a Black Forest Labs, a previsão de vídeo consome mais de 95% do compute de treinamento, enquanto o áudio responde por menos de 0,5% dos tokens. A ideia é que as modalidades se limitam mutuamente durante o treinamento.
"Nenhuma modalidade isolada oferece uma descrição completa do mundo", formula assim seu princípio a equipe de pesquisa da
Black Forest Labs.
O quanto o FLUX 3 supera os concorrentes
Em um teste preliminar de preferência humana, o FLUX 3 superou a maioria dos concorrentes. Foram comparados clipes text-to-video de 10 segundos em 720p com som.
- Luma Ray 3.2 — o FLUX 3 foi preferido em 93% das comparações
- Runway Gen-4.5 — em 77%
- Grok Imagine Video — até 69%, Kling v3 Pro — 60%
- Seedance 2.0 e Gemini Omni Flash — 52%, quase um cara ou coroa
O mesmo backbone move o FLUX-mimic — uma política de robô que, segundo a BFL, roda em menos de 80 ms em uma única placa de vídeo RTX 5090. Isso mostra que o modelo multimodal se aplica não só à geração de mídia, mas também ao controle de ações físicas.
O que isso significa
O FLUX 3 é uma aposta em um modelo foundation unificado, no qual a geração de imagens, o vídeo com som e o controle de robôs crescem a partir de pesos compartilhados. O acesso ainda é limitado: Video e Action estão abertos em acesso antecipado, Image chega mais tarde, e a Black Forest Labs promete publicar os open weights por último.
Perguntas frequentes
O que é o FLUX 3?
O FLUX 3 é o modelo flow multimodal da Black Forest Labs, treinado simultaneamente em imagens, vídeo e som. A partir de um único conjunto de pesos, ele gera imagens, vídeos de até 20 segundos com áudio nativo e prevê ações de um robô.
Quando os open weights do FLUX 3 serão publicados?
Ainda não há data exata. O acesso está sendo liberado por etapas: primeiro Video e Action em acesso antecipado, depois Image, enquanto a Black Forest Labs planeja publicar os open weights por último.
Com que o robô baseado no FLUX 3 funciona?
Com o FLUX-mimic — uma política de robô sobre o mesmo backbone. Segundo a Black Forest Labs, ela roda em menos de 80 ms em uma única placa de vídeo NVIDIA RTX 5090.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.