FLUX 3: Black Forest Labs presenta un solo modelo para imagen, vídeo, audio y robots
Hasta ahora, cada tarea creativa con IA vivía en su propia caja: un modelo para imagen, otro para vídeo, otro distinto para audio. Black Forest Labs acaba de romper esa separación con FLUX 3, un único modelo entrenado para entender y generar las cuatro cosas a la vez, incluidas las acciones de un brazo robótico.
Qué hace exactamente FLUX 3
La compañía alemana, conocida hasta ahora por sus modelos de imagen FLUX, presentó el 23 de julio una arquitectura multimodal unificada bautizada Self-Flow. Según el anuncio oficial de Black Forest Labs, el modelo aprende de forma conjunta estructura espacial, movimiento, sonido e interacciones físicas, en lugar de tratarlos como tareas separadas.
- Vídeo con audio nativo: clips de hasta 20 segundos generados a partir de texto, imagen o vídeo existente, con diálogo multilingüe sincronizado.
- Imagen: sigue siendo el terreno histórico de FLUX, ahora integrado en el mismo modelo.
- FLUX-mimic: una variante para robótica, desarrollada con la startup mimic robotics, que ya se prueba en tareas de manipulación real en Audi.
En sus propias pruebas internas —preliminares, sin verificación independiente todavía, según recoge The Decoder—, FLUX 3 Video fue preferido frente a Runway Gen-4.5 en el 77% de las comparaciones y frente a Luma Ray 3.2 en el 93%.

Por qué unificar modalidades cambia las reglas del juego
El argumento de Black Forest Labs es que separar imagen, vídeo y audio en modelos distintos obliga a «coser» resultados a posteriori: una voz que no encaja del todo con los labios, un sonido añadido que no nace de la propia escena. Al entrenar todo junto, la coherencia entre lo que se ve y lo que se oye mejora de forma estructural.
El modelo aprende a generar y a entender el contenido al mismo tiempo, en lugar de tratar cada formato como un problema aislado.
De momento el despliegue es escalonado: FLUX 3 Video ya está en acceso anticipado, FLUX 3 Image llegará en las próximas semanas, y la compañía ha anunciado —sin fecha cerrada— una versión de pesos abiertos llamada FLUX 3 Dev.
Toque Personal: lo que esto significa para tu negocio
Si generas contenido para redes sociales, anuncios o presentaciones, la fragmentación entre herramientas de vídeo, voz e imagen es justo la fricción que más tiempo te roba. Un modelo que resuelve las tres cosas de forma coherente no es una curiosidad técnica: es menos horas de edición y menos apps distintas que aprender.
Dicho esto, con datos «preliminares» del propio fabricante conviene aplicar la cautela de siempre:
- Espera a los tests independientes antes de migrar un flujo de producción entero a una herramienta recién anunciada.
- La robótica es la apuesta a más largo plazo: si tu negocio toca manufactura o logística, FLUX-mimic es una señal de hacia dónde va esta tecnología, aunque hoy solo esté en fase de pruebas con un socio como Audi.
- Compara varias opciones antes de comprometerte: herramientas como Seedance 2.0, una de las comparadas en las pruebas de Black Forest Labs, ya tienen ficha propia en el directorio de SimplificaconIA si quieres valorar alternativas.
¿La próxima etapa es la fusión de modalidades?
Durante 2025 y buena parte de 2026 la carrera fue por modelos cada vez más grandes dentro de una sola modalidad. FLUX 3 apunta a otra dirección: modelos que entienden el mundo de forma conjunta, con vídeo, sonido y acción física en el mismo cerebro. ¿Crees que esta fusión de modalidades es el siguiente gran salto de la IA generativa, o seguirá habiendo hueco para herramientas especializadas? Te leo en los comentarios.