HomeBody associe GPT‑6 Astra à un robot Unitree G1 pour nettoyer une cuisine inconnue de façon autonome
Des chercheurs de Stanford et du Caltech ont présenté HomeBody, un système qui relie directement le modèle GPT‑6 Astra à un robot Unitree G1, lui permettant d’explorer, de cartographier et de nettoyer une cuisine jamais vue auparavant.

Dans un effort conjoint, des chercheurs de l'Université de Stanford et du California Institute of Technology ont présenté HomeBody, une architecture novatrice qui attache le grand modèle vision‑langage GPT‑6 Astra directement à un robot quadrupède Unitree G1. L'intégration contourne la pile de contrôle traditionnelle, entraînée séparément, et repose plutôt sur le modèle de langage pour émettre des consignes de haut niveau qui sont traduites en actions robotiques via une bibliothèque de compétences extensible.
Le principe central de HomeBody est qu'un seul modèle vision‑langage interchangeable puisse servir de cerveau à un agent physique. GPT‑6 Astra reçoit les flux visuels des caméras du robot, interprète la scène et fait appel à un catalogue de compétences pré‑programmées – telles que saisir, se déplacer et manipuler les tiroirs – afin d’exécuter le comportement demandé.
Exploration et création d’un jumeau numérique
Avant toute opération de nettoyage, le robot Unitree G1 effectue un balayage exploratoire de la cuisine. Au cours de cette phase, il capture des images RVB, construit une représentation tridimensionnelle dans le simulateur Nvidia Isaac Sim et consigne les identités d’objets ainsi que leurs coordonnées spatiales dans une structure de mémoire dédiée. Ce jumeau numérique permet au robot de récupérer des objets qui seront ensuite hors de vue, offrant ainsi un modèle du monde persistant.
Le système de mémoire est délibérément conçu pour être interrogable par GPT‑6 Astra. Lorsque le modèle planifie une séquence d’actions – par exemple : « prends la tasse rouge sur le comptoir et place‑la dans le lave‑vaisselle » – il peut se référer aux emplacements stockés pour localiser la tasse même après que le robot se soit déplacé et que l’objet ne soit plus visible.
Planification guidée par le langage et auto‑correction
L’exécution d’une tâche suit un processus en boucle fermée. Le modèle de langage reçoit une consigne de haut niveau telle que « nettoie la cuisine », la décompose en sous‑objectifs et émet des commandes à la bibliothèque de compétences. Si une action échoue – par exemple, si un tiroir ne s’ouvre pas – GPT‑6 Astra détecte l’erreur grâce au retour visuel, révise son plan et tente une manœuvre corrective.
Les chercheurs attribuent explicitement cette capacité d’auto‑correction à la faculté du modèle de raisonner sur ses propres sorties et de ré‑évaluer l’état visuel après chaque étape. Aucun supervision externe ni signal de renforcement n’est requis pendant les essais.
Performance sur les benchmarks de navigation zéro‑shot
Pour évaluer la compétence de navigation de GPT‑6 Astra isolément, l’équipe a testé le modèle sur le benchmark R2R‑CE, un test de navigation incarnée zéro‑shot qui ne fournit que des images monoculaires RVB. Le modèle a atteint un taux de succès de 79 %, dépassant le meilleur résultat zéro‑shot précédemment rapporté de 13 points de pourcentage et le meilleur résultat supervisé de 6,9 points.
Ces chiffres montrent que le modèle de langage peut traduire des flux visuels bruts en décisions de navigation sans aucun ajustement spécifique à la tâche. La métrique de succès reflète la capacité du robot à atteindre une position cible dans une tolérance prédéfinie après avoir suivi le plan du modèle.
- La latence du modèle Astra ralentit l’émission des commandes.
- La surchauffe des servomoteurs des doigts du robot limite les prises prolongées.
- Le coût computationnel élevé restreint le déploiement en temps réel sur du matériel modeste.
- Les écarts de trajectoire et les échecs dans les passages étroits persistent dans les configurations complexes.
Malgré ces chiffres encourageants, l’évaluation a mis en évidence des modes de défaillance récurrents. Le robot s’est parfois écarté du trajet optimal, a peiné à franchir des couloirs étroits et a mal identifié l’atteinte du but recherché. Dans le cadre ultra‑raisonnement du benchmark, 21 échecs ont été enregistrés, dont beaucoup ont laissé le robot à plusieurs mètres de la cible.
Les auteurs soulignent que le benchmark était limité à un ensemble de validation de 100 épisodes. Aucun ajustement fin de navigation, aucune carte pré‑construite ou module de prédiction de points de passage n’a été utilisé. Ainsi, le taux de succès rapporté reflète une capacité brute zéro‑shot plutôt qu’un système optimisé.
La démonstration HomeBody elle‑même a été réalisée dans une cuisine inconnue unique. Le robot a reçu l’instruction « nettoie la cuisine », puis a exploré, cartographié et manipulé les objets de façon autonome. Toutes les actions ont été pilotées par la planification de GPT‑6 Astra et la bibliothèque de compétences, sans aucune correction humaine en boucle.
Limites et questions ouvertes
Des contraintes techniques majeures sont apparues au cours des expériences. La latence inhérente à l’interrogation d’un grand modèle de langage via une API externe introduit des délais perceptibles entre la perception et l’actuation. De plus, les servomoteurs des doigts du Unitree G1 ont présenté une accumulation de chaleur lors de saisies répétées, obligeant le système à faire des pauses ou à réduire la force de préhension pour éviter tout dommage.
La demande en calcul constitue également un obstacle. Faire fonctionner GPT‑6 Astra conjointement avec Nvidia Isaac Sim et le moteur d’exécution des compétences requiert des GPU haut de gamme et une mémoire substantielle, limitant la faisabilité du déploiement de HomeBody sur des appareils en périphérie ou dans des contextes où le coût est sensible.
Enfin, la portée de l’évaluation reste étroite. Le jeu de validation de 100 épisodes ne couvre pas la pleine diversité des agencements de cuisine, des variétés d’objets ou des complexités d’instructions que rencontreraient des déploiements réels. Les auteurs appellent à des tests plus larges, incluant des tâches variées, des trajets de navigation plus longs et plusieurs environnements afin d’évaluer la généralisation.
Implications pratiques pour les organisations
Pour les organisations qui envisagent des robots de service autonomes, HomeBody montre une voie permettant de réduire l’effort d’ingénierie nécessaire à la programmation de contrôleurs bas‑niveau pour chaque nouvel environnement. En s’appuyant sur un modèle vision‑langage interchangeable, une plateforme robotique unique pourrait, en principe, s’adapter à différents domaines simplement en mettant à jour le modèle ou en élargissant la bibliothèque de compétences.
Cependant, les contraintes actuelles de matériel et de latence signifient que le fonctionnement en temps réel dans des contextes très actifs reste difficile. Les entreprises doivent évaluer si l’infrastructure informatique requise pour exécuter GPT‑6 Astra à grande échelle correspond à leur budget et à leurs tolérances de latence.
Les modes de défaillance documentés suggèrent également que les applications critiques pour la sécurité devront intégrer des garde‑fous supplémentaires, tels que des planificateurs de navigation de secours ou des systèmes de surveillance en temps réel, afin de limiter les écarts de trajectoire et d’assurer une vérification fiable des objectifs atteints.
En résumé, HomeBody constitue une preuve de concept convaincante montrant que les grands modèles vision‑langage peuvent piloter directement des agents incarnés dans des espaces domestiques non structurés. L’approche réduit la dépendance à l’entraînement de contrôleurs spécifiques à chaque tâche, mais introduit de nouveaux défis d’ingénierie liés au calcul, à la gestion thermique et à la robustesse, que les organisations devront résoudre avant d’envisager une adoption à grande échelle.
Sources
- Researchers plug GPT-6 Astra directly into a robot and let it clean up an unfamiliar kitchenThe Decoder · 27 septembre 2026
- GPT-6-Astra Lights Up Embodied Navigation Evaluation in Zero-Shot Vision-and-Language Navigation in Continuous EnvironmentsarXiv · 26 septembre 2026



