FLUX 3 Action, de Black Forest Labs, lidera RoboLab con un modelo robótico abierto de 7B
Black Forest Labs publica FLUX 3 Action, un modelo abierto de 7.000 millones de parámetros que predice a la vez el vídeo y las acciones de un robot. Es primero en el banco de pruebas RoboLab-120 con un 42,92 %, por delante de Cosmos 3 Nano de NVIDIA, bajo una licencia no comercial.

Black Forest Labs, el laboratorio detrás de los modelos de imagen FLUX, da el salto a la robótica. Ha publicado FLUX 3 Action, un modelo de pesos abiertos con 7.000 millones de parámetros pensado para controlar robots, informan MarkTechPost, The Decoder y GIGAZINE. Los pesos están disponibles en Hugging Face.
FLUX 3 Action es lo que la empresa llama un modelo mundo-acción (World Action Model). Un modelo así observa las imágenes de las cámaras, el estado del robot y una instrucción escrita, y predice al mismo tiempo cómo será la escena en los instantes siguientes y qué acciones debe realizar el robot. Deriva de FLUX 3, el modelo multimodal del laboratorio entrenado sobre todo con vídeo, según The Decoder.
Qué muestran los resultados
En la clasificación RoboLab-120, que agrupa 120 tareas sobre mesa simuladas en Isaac Sim con diez intentos cada una en un brazo robótico Franka, FLUX 3 Action queda primero con una tasa de éxito del 42,92 %, informa MarkTechPost. Supera en 6,1 puntos a Cosmos 3 Nano de NVIDIA, el mejor modelo abierto hasta ahora con un 36,8 %, con un 56 % menos de parámetros. La media medida por el laboratorio en varias ejecuciones para su versión recomendada es del 42,24 %, con un margen de 0,36 puntos.
Los resultados también se sostienen en hardware real, según el mismo medio. Positronic Robotics hizo una evaluación a ciegas en un brazo Franka con diez tareas y tres intentos cada una: FLUX 3 Action completó 28 de 30 intentos, Cosmos 3 Nano 27, DreamZero 20 y la rápida política π0.5, 13.
- RoboLab-120 (simulación): 42,92 % para FLUX 3 Action, 36,8 % para Cosmos 3 Nano, 28,0 % para π0.5.
- Robot real, prueba a ciegas de Positronic Robotics: 28 de 30 intentos para FLUX 3 Action, 27 para Cosmos 3 Nano, 20 para DreamZero, 13 para π0.5.
- Velocidad: hasta 3,95 veces más rápido que Cosmos 3 Nano en FP8, según Black Forest Labs.
- Cada llamada produce 32 acciones a 15 Hz, es decir, 2,13 segundos de movimiento, frente a 1 segundo por llamada en π0.5.
El dilema que intenta resolver
Las políticas robóticas abiertas suelen obligar a elegir, explica MarkTechPost. Los modelos que predicen vídeo, como Cosmos 3 Nano, son más precisos pero caros: en un chip NVIDIA B200, Black Forest Labs midió que Cosmos 3 Nano necesita unas 4,7 veces más tiempo de cálculo que π0.5 por segundo de movimiento del robot. Los modelos de visión-lenguaje-acción como π0.5 son rápidos pero aciertan menos. FLUX 3 Action mantiene la predicción conjunta de vídeo y acciones y reduce la diferencia de velocidad con una red más pequeña y destilación.
El modelo se distribuye en tres versiones, cada una en dos precisiones numéricas: una versión base, otra entre 1,8 y 2 veces más rápida con puntuaciones algo mejores y una versión de un solo paso entre 3,15 y 4 veces más rápida a costa de perder entre 3,5 y 4,3 puntos de éxito. En una tarjeta gráfica de consumo RTX 5090, la versión más rápida sigue siendo más lenta que π0.5, apunta MarkTechPost.
Cómo se entrenó
El vídeo supuso más del 95 % de los tokens usados para preentrenar la red de FLUX 3. El entrenamiento de acciones mezcló después esos datos con vídeo alineado con acciones, procedente de grabaciones de videojuegos, vídeos en primera persona de manos humanas, pinzas de mano y robots teleoperados en 14 máquinas distintas, según MarkTechPost. El preentrenamiento importa: entrenado solo con datos de robots, el modelo se quedaba por debajo del 1 % en RoboLab; con preentrenamiento, el mismo protocolo alcanzaba el 11,6 % antes del entrenamiento adicional.
Black Forest Labs también probó el modelo como mitad rápida de un sistema híbrido, con GPT-6 Astra de OpenAI como planificador capaz de aceptar, modificar o sustituir las acciones previstas. La combinación resolvió el 90 % de los episodios con 8,77 dólares y unos 8 minutos por éxito, mientras que Astra solo, con esfuerzo máximo, los resolvió todos pero con un coste de 13,47 dólares y más de 16 minutos por éxito, informa el medio.
Condiciones de uso
Los equipos pueden adaptar el modelo a sus propios robots. El laboratorio publicó recetas de entrenamiento, entre ellas una que muestra que una habilidad de coger y dejar objetos para el brazo de bajo coste SO-101 se aprende con unas 200 demostraciones, e integró el modelo junto con NVIDIA en la plataforma LeRobot de Hugging Face, con soporte para placas NVIDIA Jetson, según MarkTechPost y GIGAZINE. La política principal necesita unos 32 GB de memoria gráfica, o cabe en tarjetas de 24 GB con precisión reducida.
Hay dos límites importantes. La licencia FLUX Kommunity solo permite el uso no comercial. Y el modelo genera objetivos articulares sin límites integrados de velocidad, fuerza o espacio de trabajo: la aplicación debe imponerlos, insiste MarkTechPost. Black Forest Labs también ve usos fuera de la robótica, como videojuegos, control de vehículos y agentes que manejan un ordenador, según The Decoder y GIGAZINE.
Qué cambia para las empresas españolas
Para las start-ups de robótica, los integradores y los laboratorios universitarios, FLUX 3 Action es una nueva referencia gratuita con la que comparar los modelos de NVIDIA en sus propias tareas, con recetas publicadas que abaratan la prueba. No es un producto para desplegar en una línea de producción: la licencia prohíbe el uso comercial sin otro acuerdo y los límites de seguridad de fuerza y velocidad siguen siendo responsabilidad del integrador. Quien piense usarlo debe prever ese trabajo de ingeniería y una negociación de licencia comercial antes de cualquier despliegue en un cliente.
Fuentes
- Black Forest Labs Releases FLUX 3 Action: A 7B Open-Weights World Action Model That Tops RoboLab-120MarkTechPost · 24 de septiembre de 2026
- Black Forest Labs stellt FLUX 3 Action vor: Offenes KI-Modell soll Robotern das Handeln beibringenThe Decoder · 24 de septiembre de 2026
- ロボット制御向けAIモデル「FLUX 3 Action」をBlack Forest Labsが公開GIGAZINE · 25 de septiembre de 2026



