HomeBody conecta GPT‑6 Astra al robot Unitree G1 para limpiar cocinas desconocidas de forma autónoma
Investigadores de Stanford y Caltech presentan HomeBody, que une GPT‑6 Astra con un robot Unitree G1 y le permite explorar, mapear y ordenar una cocina sin capas de control preentrenadas.

En una colaboración entre la Universidad de Stanford y el Instituto de Tecnología de California, se ha presentado HomeBody, una arquitectura novedosa que acopla directamente el gran modelo visión‑lenguaje GPT‑6 Astra a un robot cuadrúpedo Unitree G1. La integración evita la pila de control tradicional entrenada por separado y, en su lugar, confía en el modelo de lenguaje para emitir órdenes de alto nivel que se traducen en acciones robóticas mediante una biblioteca extensible de habilidades.
El supuesto central de HomeBody es que un único modelo visión‑lenguaje intercambiable puede actuar como el cerebro de un agente físico. GPT‑6 Astra recibe la entrada visual de las cámaras del robot, interpreta la escena y llama a un catálogo de habilidades preprogramadas –como agarre, navegación y manipulación de cajones– para ejecutar el comportamiento indicado.
Exploración y creación de gemelo digital
Antes de iniciar cualquier operación de limpieza, el robot Unitree G1 realiza una exploración preliminar de la cocina. En esta fase captura imágenes RGB, construye una representación tridimensional dentro de Nvidia Isaac Sim y registra identidades de objetos y coordenadas espaciales en una estructura de memoria dedicada. Este gemelo digital permite al robot recuperar artículos que luego quedan fuera de la vista, proporcionando un modelo de mundo persistente.
El sistema de memoria está diseñado deliberadamente para ser consultable por GPT‑6 Astra. Cuando el modelo planifica una secuencia de acciones –por ejemplo, “recoge la taza roja del mostrador y colócala en el lavavajillas”– puede referirse a las ubicaciones almacenadas para localizar la taza aun cuando el robot se haya alejado y el objeto ya no sea visible.
Planificación guiada por lenguaje y autocorrección
La ejecución de la tarea sigue un proceso de bucle cerrado. El modelo de lenguaje recibe una instrucción de alto nivel como “limpia la cocina”, la descompone en sub‑objetivos y envía comandos a la biblioteca de habilidades. Si una acción falla –por ejemplo, si un cajón no se abre– GPT‑6 Astra detecta el error mediante retroalimentación visual, revisa su plan y realiza una maniobra correctiva.
Los investigadores atribuyen explícitamente esta capacidad autocorrectiva a la habilidad del modelo de razonar sobre sus propias salidas y reevaluar el estado visual después de cada paso. No se requiere supervisión externa ni señal de refuerzo durante las pruebas.
Rendimiento en benchmarks de navegación zero‑shot
Para evaluar la competencia de navegación de GPT‑6 Astra de forma aislada, el equipo lo probó con el benchmark R2R‑CE, una prueba de navegación incorporada zero‑shot que solo suministra imágenes monoculares RGB. El modelo alcanzó una tasa de éxito del 79 %, superando el mejor resultado zero‑shot previamente reportado por 13 puntos porcentuales y el mejor resultado supervisado por 6,9 puntos.
Estas cifras demuestran que el modelo de lenguaje puede traducir flujos visuales crudos en decisiones de navegación sin ningún ajuste fino específico de la tarea. La métrica de éxito refleja la capacidad del robot para llegar a una ubicación objetivo dentro de una tolerancia predefinida tras seguir el plan del modelo.
- La latencia del modelo Astra retrasa la emisión de comandos.
- El sobrecalentamiento de los servos de los dedos del robot limita el agarre prolongado.
- El alto coste computacional restringe el despliegue en tiempo real en hardware modesto.
- Desviaciones de ruta y fallos en pasillos estrechos persisten en diseños complejos.
A pesar de los sólidos números del benchmark, la evaluación destacó modos de falla recurrentes. El robot a veces se desviaba de la ruta óptima, tenía dificultades para pasar por corredores estrechos y confundía si había alcanzado el objetivo previsto. En el entorno ultra‑razonador del benchmark se registraron 21 fallas, muchas de las cuales dejaron al robot a varios metros del objetivo.
Los autores subrayan que el benchmark estaba limitado a un conjunto de validación de 100 episodios. No se empleó ajuste fino de navegación, mapas preconstruidos ni módulos de predicción de waypoints. Por lo tanto, la tasa de éxito reportada refleja una capacidad cruda zero‑shot más que un sistema optimizado.
La demostración de HomeBody se realizó en una única cocina desconocida. El robot recibió la instrucción “limpia la cocina” y procedió a explorar, mapear y manipular objetos de forma autónoma. Todas las acciones fueron impulsadas por la planificación de GPT‑6 Astra y la biblioteca de habilidades, sin ninguna corrección humana en el bucle.
Limitaciones y preguntas abiertas
De los experimentos surgieron restricciones técnicas clave. La latencia inherente a la consulta de un modelo de lenguaje grande a través de una API externa introduce demoras perceptibles entre la percepción y la actuació́n. Además, los servos de los dedos del Unitree G1 acumularon calor durante agarres repetidos, obligando al sistema a pausar o reducir la fuerza de agarre para evitar daños.
La demanda computacional también representa una barrera. Ejecutar GPT‑6 Astra junto con Nvidia Isaac Sim y el motor de ejecución de habilidades requiere GPUs de gama alta y memoria sustancial, lo que limita la viabilidad de desplegar HomeBody en dispositivos de borde o entornos con presupuestos restringidos.
Finalmente, el alcance de la evaluación sigue siendo estrecho. El conjunto de validación de 100 episodios no cubre la completa diversidad de disposiciones de cocinas, variedades de objetos o complejidades de instrucciones que encontraría una implementación real. Los autores solicitan pruebas más amplias en tareas variadas, rutas de navegación más largas y múltiples entornos para medir la generalización.
Implicaciones prácticas para organizaciones
Para organizaciones que consideren robots de servicio autónomos, HomeBody muestra una vía para reducir el esfuerzo de ingeniería necesario para programar controladores de bajo nivel en cada nuevo entorno. Al aprovechar un modelo visión‑lenguaje intercambiable, una única plataforma robótica podría, en principio, adaptarse a diferentes dominios simplemente actualizando el modelo o ampliando la biblioteca de habilidades.
Sin embargo, las actuales limitaciones de hardware y latencia hacen que la operación en tiempo real en entornos con alta actividad siga siendo un desafío. Las empresas deben evaluar si la infraestructura computacional requerida para ejecutar GPT‑6 Astra a escala se alinea con su presupuesto y tolerancia a la latencia.
Los modos de falla documentados también indican que aplicaciones críticas de seguridad necesitarán salvaguardas adicionales, como planificadores de navegación de respaldo o sistemas de monitorización en tiempo real, para mitigar desviaciones de ruta y garantizar una verificación fiable del objetivo.
En resumen, HomeBody constituye una prueba de concepto convincente de que los grandes modelos visión‑lenguaje pueden conducir directamente a agentes incorporados en espacios domésticos no estructurados. El enfoque reduce la dependencia de entrenamientos de control específicos de la tarea, pero introduce nuevos retos de ingeniería relacionados con el cómputo, la gestión térmica y la robustez, que las organizaciones deberán resolver antes de una adopción a gran escala.
Fuentes
- Researchers plug GPT-6 Astra directly into a robot and let it clean up an unfamiliar kitchenThe Decoder · 27 de septiembre de 2026
- GPT-6-Astra Lights Up Embodied Navigation Evaluation in Zero-Shot Vision-and-Language Navigation in Continuous EnvironmentsarXiv · 26 de septiembre de 2026



