Black Forest Labs (BFL), el laboratorio detrás de los modelos de imágenes FLUX, ha lanzado FLUX 3 Action. Es un modelo de acción mundial (WAM) de pesos abiertos 7B para control de robots. El modelo lee los fotogramas de la cámara, el estado del robot y una instrucción de texto. Luego predice fotogramas de vídeo futuros y la siguiente parte de acciones juntas. En la clasificación de RoboLab-120, ocupa el primer lugar con un 42,92 % de éxito en la tarea.
¿Es desplegable? Sí, con condiciones. La política DROID necesita alrededor de 32 GB de memoria GPU en BF16 en un H200. Admite tarjetas de 24 GB con cuantificación FP8 y descarga de codificador de texto. La licencia FLUX Kommunity permite un uso no comercial.
Los objetivos de acción compensatorios de FLUX 3
Las políticas de robots abiertos suelen obligar a tomar una decisión. Los WAM como el Cosmos 3 Nano de NVIDIA lideran a RoboLab con un 36,8%, pero predecir vídeo es caro. Los VLA como π0,5 son rápidos, pero alcanzan sólo el 28,0%. En un B200, BFL midió que Cosmos 3 Nano (FP8) necesita aproximadamente 4,7 veces más tiempo de procesamiento que π0,5 (BF16) por segundo de movimiento del robot.
FLUX 3 Action mantiene la predicción conjunta de vídeo y acción. BFL cierra la brecha de velocidad con una columna vertebral más pequeña y con destilación.
Arquitectura y Formación
FLUX 3 Action se deriva de la columna vertebral multimodal FLUX 3. El preentrenamiento utilizó datos de imagen, video y audio, y el video constituyó más del 95% de los tokens de entrenamiento. El texto, el vídeo y el estado del robot se codifican en tokens. Los tokens futuros de la red troncal se decodifican en fotogramas de vídeo y sus tokens de acción en acciones de robot.
El entrenamiento medio combinó datos de preentrenamiento (36,95 % de las muestras) con videos alineados con la acción (63,05 %). Los datos de acción cubrieron grabaciones de juegos, videos de manos humanas egocéntricas, pinzas portátiles y teleoperación en 14 realizaciones. La mayoría de los datos de los robots utilizan un espacio de acción de efector final compartido de 50 dimensiones llamado EE50.
La formación previa es muy importante aquí. Sin él, la capacitación únicamente con DROID se mantuvo por debajo del 1% en RoboLab. Con preentrenamiento, el mismo protocolo alcanzó el 11,6%.
Resultados de referencia
RoboLab-120 tiene 120 tareas de mesa en Isaac Sim, con 10 pruebas cada una en una configuración Franka estilo DROID.
Esto supone una ventaja de 6,1 puntos porcentuales con un 56% menos de parámetros que el Cosmos 3 Nano. La cifra del 42,92% es la entrada en la clasificación. La media de semillas múltiples de BFL para el punto de control del 8PM destilado con orientación es 42,24% ± 0,36.
Los resultados reales del hardware siguen el mismo patrón. Positronic Robotics realizó una evaluación ciega en un brazo Franka con 10 tareas DROID y 3 intentos cada una. FLUX 3 Action completó 28 de 30 intentos (93,3%). Cosmos 3 Nano obtuvo una puntuación de 27/30, DreamZero 20/30 y π0,5 13/30.
3 puntos de control, 3 puntos de velocidad
BFL envía la política DROID en 3 recetas, cada una en BF16 y FP8:
Base: 4 pasos de muestreo con guía dividida (video CFG 4, acción CFG 1). Orientación destilada: deja caer la segunda pasada de guía, corre de 1,8 a 2 veces más rápido y obtiene una puntuación de 0,6 a 1,08 pp más alta. Destilado por pasos: 1 paso de muestreo, de 3,15 a 4 veces más rápido, con una caída de éxito de 3,51 a 4,32 pp.
En comparación con Cosmos 3 Nano en FP8, los puntos de control básicos y de orientación se ejecutan entre 1,52 y 3,95 veces más rápido en GPU de consumo, estaciones de trabajo y centros de datos.
Cada llamada produce 32 acciones a 15 Hz, o 2,13 segundos de movimiento. π0,5 produce 1,0 segundo por llamada. Por lo tanto, BFL informa la velocidad como un factor en tiempo real, no como la latencia por llamada. En el FP8, el punto de control destilado por pasos supera a π0,5 entre 1,34x y 2,28x en las GPU de estaciones de trabajo y centros de datos. En un RTX 5090, es más lento que π0,5.
‘+(r[2]===28?’28.0′:(r[2]===39?’39.0’:Cadena(r[2])))+’%
‘; d.addEventListener(‘hacer clic’, función(){ document.getElementById(‘barNote’).textContent = r[0]+’: ‘+r[2]+’% éxito (‘+r[1]+’).’; }); d.addEventListener(‘keydown’, function(e){ if(e.key===’Enter’||e.key===’ ‘){ e.preventDefault(); d.click(); } }); host.appendChild(d); requestAnimationFrame(function(){ requestAnimationFrame(function(){ d.querySelector(‘.fill’).style.width = (r[2]/45*100)+’%’; }); }); }); setTimeout(cambiar tamaño, 60); } document.getElementById(‘openOnly’).addEventListener(‘click’, function(){ showClosed=false; this.setAttribute(‘aria-pressed’,’true’); document.getElementById(‘withClosed’).setAttribute(‘aria-pressed’,’false’); drawBars(); }); document.getElementById(‘withClosed’).addEventListener(‘click’, function(){ showClosed=true; this.setAttribute(‘aria-pressed’,’true’); document.getElementById(‘openOnly’).setAttribute(‘aria-pressed’,’false’); drawBars(); }); /* 4 carreras: factor de tiempo real en B200 */ var RACE = [
[‘F3A step-distilled’,’37.92% success’,15,’me’],
[‘π0.5 (BF16)’,’28.0% success’,32,”],
[‘F3A guidance-distilled’,’42.24% success’,48,’me’],
[‘Cosmos 3 Nano’,’36.8% success’,150,”]
]; var carrera = document.getElementById(‘carrera’); RACE.forEach(function(r){ var d = document.createElement(‘div’); d.className=”r “+r[3]; d.innerHTML = ‘
‘+r[0]+”+r[1]+’
‘+r[2]+’sra.
‘; carrera.appendChild(d); }); document.getElementById(‘goRace’).addEventListener(‘click’, function(){ var bars = race.querySelectorAll(‘.t i’), t0=null; bars.forEach(function(b){ b.style.width=”0″; }); function frame(ts){ if(!t0) t0=ts; var el = reducir? 1e9 : (ts-t0)/10; var hecho = verdadero; RACE.forEach(function(r,i){ var k = Math.min(1, el/r[2]); verja[i].estilo.ancho = (k*r[2]/150*100)+’%’; si(k<1) hecho=falso; }); if(!done) requestAnimationFrame(marco); } requestAnimationFrame(marco); }); /* 5 implementar */ veredicto de función(){ var v = document.querySelector('entrada[name=vram]:marcado').valor, u = document.querySelector('entrada[name=use]:marcado').valor; var box = document.getElementById('veredicto'), hw, lic, cls; if(v==='32') hw = 'Hardware: encaja. La política DROID utiliza alrededor de 32 GB en BF16 en un H200.'; else if(v==='24') hw = 'Hardware: encaja con --quantize fp8 y --offload-text-encoder, según la tarjeta modelo.'; else hw = 'Hardware: no cubierto. BFL enumera 24 GB como el ajuste más pequeño probado.'; if(u==='res') lic="Licencia: permitida. Se permite el uso no comercial y no productivo, incluida la robótica no comercial."; else if(u==='small') lic="Licencia: los resultados (incluidas las predicciones de acciones) pueden ser utilizados comercialmente por usuarios calificados con ingresos anuales de USD 5 millones. Lea los términos antes de la producción."; else lic="Licencia: necesita una licencia comercial de Black Forest Labs."; cls = (v==='lt24'||u==='grande')? (v==='lt24'&&u==='grande'?'no':'advertir'): 'ok'; var cabeza = cls==='ok'? 'Implementable para su configuración': cls==='advertir'? 'Implementable con cambios' : 'No implementable tal cual'; box.className="veredicto "+cls; box.innerHTML = ''+cabeza+'
‘+hw+’
‘+lic+’
El modelo genera objetivos conjuntos sin límites de velocidad, fuerza o espacio de trabajo. Su aplicación debe hacerlas cumplir y mantener una parada de hardware a su alcance.
‘; setTimeout(cambiar tamaño, 30); } document.querySelectorAll(‘.qs input’).forEach(function(i){ i.addEventListener(‘cambio’, veredicto); }); veredicto(); window.addEventListener(‘cargar’, cambiar tamaño); window.addEventListener(‘cambiar tamaño’, cambiar tamaño); setTimeout(cambiar tamaño, 300); })();