FLUX 3 integra imágenes, vídeo, audio y acciones robóticas en un solo modelo
Black Forest Labs lanzó FLUX 3 el 23 de julio, y el salto es mayor de lo que sugiere el número de versión. El laboratorio de Friburgo se dio a conocer con FLUX, los modelos de imagen que generan contenido artístico dentro de Photoshop, Canva, Picsart y, más cerca de nosotros, dentro de Cinevva para quienes eligen el proveedor Flux. FLUX 3 es la primera incursión de la empresa en el vídeo, pero no presenta un modelo de vídeo independiente. Entrena un único conjunto de pesos con imágenes, vídeo y audio a la vez, y después amplía esa misma arquitectura base para predecir acciones robóticas. Un modelo, cuatro tipos de resultados.
Un primer vistazo a lo que genera FLUX 3 Video
Una sola arquitectura base, no cuatro productos unidos entre sí
La propuesta se basa en una idea de investigación que BFL denomina Self-Flow: en lugar de aprender la generación de imágenes, vídeo y audio como problemas separados, se aprende una única representación de cómo funciona el mundo. Una imagen es un corte del espacio en un momento determinado. El vídeo añade tiempo y movimiento. El audio contiene el vínculo causal entre un impacto y el sonido que produce. Al entrenar con todos estos elementos a la vez, las restricciones se refuerzan mutuamente, de modo que el sonido debe corresponderse con el movimiento y este debe obedecer las leyes de la física. La sorpresa del lanzamiento es que la predicción de acciones surgió de la misma arquitectura base sin perjudicar la calidad del vídeo; por eso FLUX 3 puede controlar un brazo robótico y generar un videoclip musical con los mismos pesos.
El vídeo, en términos concretos
FLUX 3 Video crea clips de hasta 20 segundos en una sola pasada, con audio nativo generado junto con la imagen, incluidos diálogos, efectos de sonido y ruido ambiental. Esa duración iguala al ya clausurado Sora de OpenAI y supera a la mayor parte de los modelos actuales. Admite texto a vídeo, imagen a vídeo, vídeo a vídeo, transiciones entre fotogramas clave, diálogos multilingües y encadenamiento autónomo de clips para formar secuencias de varios planos. En las primeras pruebas de BFL con clips de 10 segundos a 720p, los evaluadores lo prefirieron frente a Luma Ray 3.2 en el 93 % de las comparaciones y frente a Runway Gen-4.5 en el 77 %. Ante los rivales más potentes, la diferencia se reduce prácticamente a un cara o cruz: obtuvo un 52 % de preferencia tanto frente a Seedance 2.0 de ByteDance como frente a Gemini Omni Flash de Google. Son cifras preliminares del propio laboratorio, así que deben considerarse una afirmación, no un veredicto.
La contrapartida es el acceso. FLUX 3 Video se encuentra en una fase de acceso anticipado restringido mediante la API y pesos privados, por lo que hay que solicitar acceso y recibir aprobación. FLUX 3 Action está disponible únicamente para socios y ya se está probando en una línea de producción real de Audi a través de la startup de robótica mimic. FLUX 3 Image, la variante que realmente interesa a la mayoría de los diseñadores, llegará en las próximas semanas. FLUX 3 Dev, la arquitectura base con pesos abiertos que interesa a quienes trabajan con inferencia local, no está prevista hasta más adelante en 2026.
Por qué nos importa que un laboratorio de imagen dé el salto a lo multimodal
Seguimos de cerca a BFL porque Cinevva ya utiliza su tecnología. Cuando uno de los dos laboratorios cuyos modelos de imagen están integrados en las mayores herramientas creativas del mundo decide que su futuro pasa por un modelo unificado de vídeo, audio y acciones, estamos ante una señal sobre el rumbo de toda la infraestructura de creación, no solo ante un juguete nuevo. La frontera entre «generar una imagen», «generar un clip» y «simular un mundo en el que se puede actuar» se está disolviendo en un único modelo, y es la misma convergencia que señalamos desde la otra dirección con el modelo de mundo MIRA.
Para los creadores, la conclusión práctica sigue siendo la misma. Un modelo de vídeo mejor, más largo y con audio nativo vuelve a reducir el coste del primer borrador, igual que hicieron antes Seedance, Kling y Gemini. Lo que no cambia es la parte que siempre ha sido difícil: saber qué merece la pena crear y después iterar sobre un clip generado hasta convertirlo en algo que la gente realmente quiera ver o jugar. Ese es el ciclo en torno al que seguimos construyendo: desde el prompt hasta compartir, remezclar y publicar en la web abierta. FLUX 3 hace que la materia prima sea más barata y mejor. Convertir ese material en un juego o una historia que importe a la gente sigue siendo el verdadero trabajo.
Referencias
- Black Forest Labs: FLUX 3, modelos del mundo real
- VentureBeat: Black Forest Labs lanza FLUX 3
- Decrypt: FLUX 3 deja atrás las imágenes estáticas para centrarse en el vídeo y las manos robóticas
- The Decoder: Flux 3 genera vídeos de hasta 20 segundos con audio nativo
- Comunicado de prensa de Black Forest Labs (GlobeNewswire)