FLUX 3 integra imagem, vídeo, áudio e ações robóticas em um único modelo
A Black Forest Labs lançou o FLUX 3 em 23 de julho, e o salto é maior do que o número da versão sugere. O laboratório de Freiburg construiu sua reputação com o FLUX, a família de modelos de imagem que gera arte dentro do Photoshop, do Canva, do Picsart e, mais perto de nós, dentro da Cinevva para todos que escolhem o provedor Flux. O FLUX 3 marca a primeira vez que a empresa oferece geração de vídeo, mas ela não lançou um modelo separado para isso. Em vez disso, treinou um único conjunto de pesos simultaneamente com imagens, vídeos e áudio, e então estendeu essa mesma base para prever ações robóticas. Um modelo, quatro tipos de saída.
Uma primeira amostra do que o FLUX 3 Video gera
Uma única base, não quatro produtos unidos à força
A proposta se apoia em uma ideia de pesquisa que a BFL chama de Self-Flow: em vez de aprender a gerar imagens, vídeos e áudio como problemas separados, o modelo aprende uma única representação de como o mundo funciona. Uma imagem é um recorte do espaço em determinado momento. O vídeo acrescenta tempo e movimento. O áudio carrega a relação causal entre um impacto e o som produzido por ele. Ao treinar tudo isso em conjunto, as restrições se reforçam mutuamente, de modo que o som precisa corresponder ao movimento, e o movimento precisa obedecer à física. A surpresa do lançamento é que a previsão de ações surgiu a partir da mesma base sem prejudicar a qualidade do vídeo, razão pela qual o FLUX 3 consegue controlar um braço robótico e gerar um videoclipe usando os mesmos pesos.
O vídeo, na prática
O FLUX 3 Video cria clipes de até 20 segundos em uma única passagem, com áudio nativo gerado junto com a imagem, incluindo diálogos, efeitos sonoros e ruído ambiente. Essa duração iguala a do Sora, agora descontinuado pela OpenAI e supera a maioria dos modelos atuais nesse quesito. Ele oferece suporte a texto para vídeo, imagem para vídeo, vídeo para vídeo, transições entre quadros-chave, diálogos multilíngues e encadeamento agêntico de clipes em sequências com vários planos. Nos primeiros testes da própria BFL com clipes de 10 segundos em 720p, os avaliadores o preferiram ao Luma Ray 3.2 em 93% das comparações e ao Runway Gen-4.5 em 77%. Contra os rivais mais fortes, a margem cai para um empate técnico: 52% de preferência sobre o Seedance 2.0 da ByteDance e o Gemini Omni Flash do Google. Esses são números preliminares do próprio laboratório, portanto devem ser tratados como uma alegação, não como um veredito.
A limitação é o acesso. O FLUX 3 Video está em acesso antecipado restrito por meio da API e de pesos privados, e é preciso se inscrever e receber aprovação. O FLUX 3 Action está disponível apenas para parceiros e já está sendo testado em uma linha de produção real da Audi por meio da startup de robótica mimic. O FLUX 3 Image, a versão que a maioria dos designers realmente deseja, chega nas próximas semanas. Já a base FLUX 3 Dev com pesos abertos, a parte que interessa ao público de inferência local, só está prevista para mais adiante em 2026.
Por que um laboratório de imagens se tornando multimodal importa para nós
Acompanhamos a BFL de perto porque a Cinevva já usa o trabalho do laboratório. Quando um dos dois laboratórios cujos modelos de imagem estão presentes nas maiores ferramentas criativas do mundo decide que seu futuro é um modelo unificado de vídeo, áudio e ações, isso sinaliza o rumo de toda a cadeia de criação, não apenas a chegada de um brinquedo novo. A divisão entre “gerar uma imagem”, “gerar um clipe” e “simular um mundo no qual você pode agir” está se dissolvendo em um único modelo, e é a mesma convergência que destacamos no modelo de mundo MIRA, vista a partir da direção oposta.
Para criadores, a leitura prática continua a mesma. Um modelo de vídeo melhor, mais longo e com áudio nativo reduz novamente o custo do primeiro rascunho, assim como Seedance, Kling e Gemini fizeram antes dele. O que ele não resolve é a parte que sempre foi difícil: saber o que vale a pena criar e depois transformar, por meio de iterações, um clipe gerado em algo que as pessoas realmente queiram assistir ou jogar. É em torno desse ciclo que continuamos construindo, desde o prompt até o compartilhamento, a remixagem e a publicação na web aberta. O FLUX 3 torna a matéria-prima mais barata e melhor. Transformar esse material em um jogo ou uma história com que as pessoas se importem ainda é o verdadeiro trabalho.
Referências
- Black Forest Labs: FLUX 3, modelos do mundo real
- VentureBeat: Black Forest Labs lança o FLUX 3
- Decrypt: FLUX 3 deixa as imagens estáticas para trás em favor de vídeos e mãos robóticas
- The Decoder: Flux 3 gera vídeos com áudio nativo de até 20 segundos
- Comunicado de imprensa da Black Forest Labs (GlobeNewswire)