Tecnología

FLUX 3: el modelo que genera video, audio e imagen desde un solo cerebro — y ya aplastó a Runway

FLUX 3 — modelo multimodal de Black Forest Labs

Los creadores de Stable Diffusion y del modelo FLUX acaban de cambiar el tablero de la generación de contenido con IA. Black Forest Labs lanzó FLUX 3 el 23 de julio, y no es solo otra actualización: es el primer modelo de la compañía que aprende video, imágenes y audio al mismo tiempo, en una sola arquitectura unificada.

Por qué importa que sea "un solo modelo"

La mayoría de los modelos actuales se especializan: uno para imágenes, otro para video, otro para audio. FLUX 3 se entrenó con todos esos datos a la vez, en lo que Black Forest Labs llama la arquitectura Self-Flow. La idea es que un modelo que aprende video aprende también cómo se mueven los objetos y cómo suena un impacto. Un modelo que aprende audio entiende qué eventos generan qué sonidos. Los tres juntos arman una representación del mundo más coherente que cualquier especialista por separado.

En la práctica: cuando generás un video con FLUX 3, el audio que acompaña no se pega encima — se genera junto con las imágenes porque el modelo entiende que ese golpe en pantalla debe sonar así. Parece un detalle, pero es exactamente lo que hace que los videos de generación de IA sigan sintiéndose falsos.

Qué puede hacer

FLUX 3 Video genera clips de hasta 20 segundos desde texto, imágenes o video de referencia, todo con audio nativo. Soporta text-to-video, image-to-video (animación o referencia de estilo), video-to-video para transportar un personaje a otra escena, keyframe-to-video para transiciones controladas y diálogo multilingüe. Los clips individuales se pueden encadenar en secuencias más largas de forma agéntica.

En benchmarks preliminares, FLUX 3 fue preferido sobre Runway Gen-4.5 en el 77% de las comparaciones y sobre Luma Ray 3.2 en el 93%. También supera a Grok Imagine Video en el 69% de los casos. Estos son números de early access, el modelo va a seguir mejorando.

FLUX 3 Image todavía no salió al público: Black Forest Labs prometió un early access en las próximas semanas. Lo que sí está disponible desde ya es FLUX 3 Video a través de plataformas como Krea (con créditos gratuitos diarios), Canva, Magnific y Picsart.

El lado más raro: robots en Audi

Además de la generación de contenido, FLUX 3 tiene una rama llamada FLUX 3 Action que predice acciones físicas para robótica. Black Forest Labs y la startup mimic robotics lanzaron conjuntamente FLUX-mimic, un modelo video-acción que ya está operando en plantas de producción de Audi. El mismo backbone que genera video puede entrenarse para que un robot manipule objetos físicos con solo 30 minutos de datos de entrenamiento por tarea. Suena a ciencia ficción, pero es lo que está pasando.

Acceso y precios

FLUX 3 Video y FLUX 3 Action están en early access desde el 23 de julio. Se puede solicitar acceso directo a la API a través de bfl.ai. Black Forest Labs prometió también liberar pesos abiertos (open weights) de FLUX 3 Dev más adelante en 2026, consistente con su historial de open source. No anunciaron precios de API todavía, pero dijeron que será accesible para desarrolladores. Los creadores del FLUX original acumularon más de 500 millones de descargas de sus modelos, así que el historial de acceso abierto habla solo.

Si creás contenido, hacés diseño o simplemente seguís de cerca la generación de imágenes y video con IA, FLUX 3 es el modelo a vigilar en los próximos meses.