HomeBody verbindet GPT‑6 Astra mit Unitree G1 für autonome Küchenaufräumung
Stanford‑ und Caltech‑Forscher zeigen HomeBody, ein System, das GPT‑6 Astra direkt an einen Unitree G1‑Roboter koppelt und so eine unbekannte Küche erkunden, kartieren und säubern lässt.

In einer gemeinsamen Initiative haben Forscher der Stanford University und des California Institute of Technology HomeBody vorgestellt, eine neuartige Architektur, die das große Vision‑Language‑Modell GPT‑6 Astra unmittelbar an einen vierbeinigen Unitree G1‑Roboter anschließt. Die Integration umgeht den traditionellen, separat trainierten Steuerungs‑Stack und lässt das Sprachmodell stattdessen hoch‑level Befehle ausgeben, die über eine erweiterbare Skill‑Bibliothek in Roboter‑Aktionen übersetzt werden.
Der Kern von HomeBody ist die Annahme, dass ein einziges, austauschbares Vision‑Language‑Modell als Gehirn für einen physischen Agenten dienen kann. GPT‑6 Astra empfängt visuelle Eingaben von den Kameras des Roboters, interpretiert die Szene und greift auf einen Katalog vorprogrammierten Fähigkeiten – wie Greifen, Navigation und Schubladen‑Manipulation – zurück, um das gewünschte Verhalten auszuführen.
Erkundung und Erstellung eines digitalen Zwillings
Bevor irgendeine Reinigungsaktion startet, führt der Unitree G1‑Roboter einen explorativen Durchlauf der Küche durch. In dieser Phase nimmt er RGB‑Bilder auf, erstellt ein dreidimensionales Modell in Nvidia’s Isaac Sim und speichert Objektidentitäten sowie räumliche Koordinaten in einer dedizierten Speicherstruktur. Dieser digitale Zwilling ermöglicht es dem Roboter, später nicht mehr sichtbare Gegenstände wiederzufinden und liefert ihm ein persistentes Weltmodell.
Das Speichersystem ist bewusst so gestaltet, dass GPT‑6 Astra darauf zugreifen kann. Plant das Modell zum Beispiel die Sequenz „Nimm den roten Becher vom Tresen und lege ihn in die Spülmaschine“, kann es auf die gespeicherten Positionen verweisen, um den Becher zu lokalisieren, selbst wenn der Roboter bereits weitergezogen ist und das Objekt nicht mehr im Sichtfeld ist.
Sprachgesteuerte Planung und Selbstkorrektur
Die Aufgabenausführung folgt einem geschlossenen Regelkreis. Das Sprachmodell erhält eine hoch‑level Anweisung wie „Räume die Küche auf“, zerlegt sie in Teilziele und gibt Befehle an die Skill‑Bibliothek. Scheitert eine Aktion – etwa weil sich eine Schublade nicht öffnen lässt – erkennt GPT‑6 Astra den Fehler über visuelles Feedback, überarbeitet den Plan und versucht eine korrigierende Bewegung.
Die Forscher führen diese Selbstkorrektur explizit auf die Fähigkeit des Modells zurück, über seine eigenen Ausgaben zu reasoning und den visuellen Zustand nach jedem Schritt neu zu evaluieren. Während der Testläufe ist keinerlei externe Aufsicht oder Verstärkungs‑Signal nötig.
Leistung bei Zero‑Shot‑Navigations‑Benchmarks
Um die Navigationskompetenz von GPT‑6 Astra isoliert zu beurteilen, testete das Team das Modell am R2R‑CE‑Benchmark, einem Zero‑Shot‑Embodied‑Navigation‑Test, der ausschließlich monokulare RGB‑Bilder bereitstellt. Das Modell erreichte eine Erfolgsquote von 79 %, damit 13 Prozentpunkte über dem bislang besten veröffentlichten Zero‑Shot‑Ergebnis und 6,9 Punkte über dem besten überwachten Ergebnis lag.
Diese Zahlen zeigen, dass das Sprachmodell rohe Bildströme in Navigationsentscheidungen übersetzen kann, ohne irgendeine aufgabenspezifische Feinabstimmung. Die Erfolgsmetrik misst die Fähigkeit des Roboters, nach Befolgung des Modells einen Zielort innerhalb einer vordefinierten Toleranz zu erreichen.
- Die Latenz des Astra‑Modells verlangsamt die Befehlsausgabe.
- Überhitzung der Finger‑Servomotoren des Roboters begrenzt langanhaltendes Greifen.
- Hohe Rechenkosten schränken den Echtzeiteinsatz auf bescheidener Hardware ein.
- Routenabweichungen und Engpass‑Fehler treten in komplexen Layouts weiterhin auf.
Trotz der starken Benchmark‑Zahlen verdeutlichten die Tests wiederkehrende Fehlermodi. Der Roboter wich teilweise von optimalen Routen ab, hatte Schwierigkeiten, enge Korridore zu passieren, und erkannte nicht immer korrekt, ob er das gewünschte Ziel erreicht hatte. Im ultra‑reasoning‑Setting des Benchmarks wurden 21 Fehlversuche verzeichnet, von denen viele den Roboter mehrere Meter vom Ziel entfernten.
Die Autoren betonen, dass der Benchmark auf einen Validierungs‑Datensatz von 100 Episoden beschränkt war. Es wurden weder navigationsspezifische Feinabstimmungen, vorgefertigte Karten noch Wegpunkt‑Vorhersagemodule eingesetzt. Folglich spiegelt die gemeldete Erfolgsquote eine rohe Zero‑Shot‑Fähigkeit wider und nicht ein optimiertes Gesamtsystem.
Die HomeBody‑Demonstration selbst fand in einer einzigen, unbekannten Küchenumgebung statt. Der Roboter erhielt die Anweisung „Räume die Küche auf“ und begann eigenständig zu erkunden, zu kartieren und Objekte zu manipulieren. Alle Aktionen wurden ausschließlich durch die Planung von GPT‑6 Astra und die Skill‑Bibliothek gesteuert, ohne menschliche Eingriffe.
Einschränkungen und offene Fragen
Aus den Experimenten gingen mehrere technische Beschränkungen hervor. Die Latenz, die durch das Abfragen eines großen Sprachmodells über eine externe API entsteht, führt zu spürbaren Verzögerungen zwischen Wahrnehmung und Aktuation. Zusätzlich zeigten die Finger‑Servomotoren des Unitree G1 bei wiederholtem Greifen ein thermisches Aufwärmen, das das System zum Pausieren oder Reduzieren der Greifkraft zwang, um Schäden zu vermeiden.
Der hohe Rechenaufwand stellt ein weiteres Hindernis dar. Das gleichzeitige Ausführen von GPT‑6 Astra, Nvidia Isaac Sim und der Skill‑Ausführungsengine erfordert High‑End‑GPUs und beträchtlichen Arbeitsspeicher, was die Machbarkeit von HomeBody auf Edge‑Geräten oder in kosten‑sensitiven Szenarien stark einschränkt.
Schließlich bleibt der Evaluations‑Umfang eng. Der 100‑Episoden‑Datensatz deckt nicht die gesamte Vielfalt von Küchenlayouts, Objektvarianten und Anweisungs‑Komplexitäten ab, die in realen Anwendungen auftreten würden. Die Autoren fordern umfassendere Tests über unterschiedliche Aufgaben, längere Navigationsstrecken und mehrere Umgebungen, um die Generalisierungsfähigkeit zu prüfen.
Praktische Implikationen für Organisationen
Für Unternehmen, die autonome Service‑Roboter in Betracht ziehen, zeigt HomeBody einen Weg, den Ingenieuraufwand für das Programmieren von Low‑Level‑Controllern in jeder neuen Umgebung zu reduzieren. Durch die Nutzung eines Vision‑Language‑Modells, das ausgetauscht werden kann, könnte eine einheitliche Roboterplattform prinzipiell verschiedene Domänen bedienen, indem lediglich das Modell oder die Skill‑Bibliothek aktualisiert wird.
Allerdings bedeuten die aktuellen Hardware‑ und Latenz‑Beschränkungen, dass ein Echtzeit‑Einsatz in stark frequentierten Umgebungen nach wie vor herausfordernd ist. Unternehmen müssen prüfen, ob die notwendige Rechen‑Infrastruktur, um GPT‑6 Astra skaliert zu betreiben, mit ihrem Budget und ihren Latenz‑Toleranzen vereinbar ist.
Die dokumentierten Fehlermodi legen zudem nahe, dass sicherheitskritische Anwendungen zusätzliche Schutzmechanismen benötigen, etwa fallback‑Navigations‑Planner oder Echtzeit‑Monitoring‑Systeme, um Routenabweichungen zu kompensieren und eine zuverlässige Zielverifizierung sicherzustellen.
Zusammenfassend liefert HomeBody einen überzeugenden Proof‑of‑Concept, dass große Vision‑Language‑Modelle direkt körperliche Agenten in unstrukturierten häuslichen Räumen steuern können. Der Ansatz reduziert die Abhängigkeit von aufgabenspezifischen Steuerungs‑Trainings, bringt jedoch neue ingenieurtechnische Herausforderungen hinsichtlich Rechenleistung, thermischem Management und Robustheit mit, die Organisationen vor einer großflächigen Einführung adressieren müssen.
Quellen
- Researchers plug GPT-6 Astra directly into a robot and let it clean up an unfamiliar kitchenThe Decoder · 27. September 2026
- GPT-6-Astra Lights Up Embodied Navigation Evaluation in Zero-Shot Vision-and-Language Navigation in Continuous EnvironmentsarXiv · 26. September 2026



