Black Forest Labs (BFL) ha lanzado FLUX 3, un modelo básico multimodal que aprende de imágenes, vídeos y audio dentro de una única arquitectura. También es el primer modelo FLUX que ofrece predicción de acción, audio y video desde un conjunto de pesos.
El equipo de investigación de Black Forest Labs (BFL) sostiene que ninguna modalidad ofrece una descripción completa del mundo. Las imágenes capturan la estructura espacial en un instante. El vídeo restaura el tiempo y expone la dinámica física. El audio revela relaciones causales entre eventos mecánicos y sonido. Cada uno es tratado como una proyección con pérdidas de la misma realidad subyacente.
Entrenar en todos ellos a la vez significa que las modalidades se limitan entre sí. El sonido tiene que coincidir con el impacto. El movimiento tiene que obedecer a la masa. El equipo de investigación considera que FLUX 3 es su primer modelo construido íntegramente según ese principio.
El método subyacente: Self-Flow
FLUX 3 se basa en Self-Flow, el método de BFL para alinear la generación y la comprensión multimodal en una arquitectura. Self-Flow combina el objetivo de coincidencia de flujo con un objetivo de reconstrucción de características autosupervisado. La implementación de referencia en GitHub es Apache-2.0 y utiliza SiT-XL/2 con condicionamiento de paso de tiempo por token. Se entrena con una proporción de máscara por token del 25 % y autodestilación de un profesor de EMA en la capa 20 a un estudiante en la capa 8.
Ese punto de control publicado es un modelo de investigación ImageNet 256×256, no FLUX 3. BFL afirma que “aumentó significativamente los recursos informáticos y de datos” con el mismo enfoque para entrenar FLUX 3 en video, imágenes y audio simultáneamente. Self-Flow se presentó en marzo de 2026, por lo que no es nuevo en este lanzamiento. Lo nuevo es la escala.
¿Qué hace el vídeo FLUX 3?
FLUX 3 Video genera clips de hasta 20 segundos de duración en una sola generación, con audio nativo. Los modos admitidos cubren texto a video, imagen a video, video a video desde un clip de referencia, fotograma clave a video para transiciones controladas y continuación generativa de video y audio a partir de video y audio de entrada.
BFL también incluye diálogos multilingües, encadenamiento agente de clips en secuencias de múltiples tomas y una fuerte generación de tipografía con diseños animados. El equipo de BFL informa una fortaleza particular en las expresiones faciales humanas y en la asociación de sonidos con eventos físicos.
Actuación
El equipo de BFL publicó resultados preliminares de preferencia humana. La configuración consistió en clips de texto a vídeo de 10 segundos a 720p con audio. Se prefirió FLUX 3 a Luma Ray 3.2 en el 93 % de las comparaciones y a Runway Gen-4.5 en el 77 %. Frente a Grok Imagine Video la cifra asciende al 69%, luego Kling v3 Pro al 60%, Happy Horse v1 al 59% y Happy Horse 1.1 al 57%. Contra Seedance 2.0 y Gemini Omni Flash el resultado es del 52%, cercano al lanzamiento de una moneda.
Explorador interactivo
Comandos
>especulación
>banco
>calcular
>acción
>imitar
>lanzamiento
>autoflujo
Escriba un comando a continuación o presione ↑ / ↓ en el mensaje para recorrer el historial. Cada figura proviene de Black Forest Labs o imita la robótica.
Introduzca un comando
ingresar
Fuentes: bfl.ai/blog/flux-3 · bfl.ai/blog/flux-3-mimic · mimicrobotics.com · cifras del 23 de julio de 2026
Construido por Marktechpost
Conclusiones clave
FLUX 3 es una columna vertebral de adaptación de flujo entrenada conjuntamente en imagen, vídeo y audio. FLUX 3 Video genera hasta 20 segundos con audio nativo en una sola generación. La predicción de vídeo consume más del 95 % del cálculo de entrenamiento; el audio está por debajo del 0,5% de los tokens. La misma columna vertebral impulsa FLUX-mimic, una política de robot que se ejecuta a menos de 80 ms en un RTX 5090. El acceso está cerrado: el video y la acción están en acceso temprano, la imagen sigue, los pesos abiertos son los últimos.
Consulte el anuncio de FLUX 3, la publicación técnica de imitación de FLUX 3 x y el documento Self-Flow. Todo el crédito por esta investigación va a los investigadores de este proyecto.
Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.