HomeBody 系统将 GPT‑6 Astra 与 Unitree G1 机器人结合,实现陌生厨房的自主清洁
斯坦福大学和加州理工学院的研究者展示了 HomeBody 系统,直接把 GPT‑6 Astra 与 Unitree G1 四足机器人连接,使其能够在未预训练的情况下探索、绘制数字孪生并自行清理陌生厨房。

在斯坦福大学与加州理工学院的联合研究中,科研团队推出了 HomeBody,这是一种新颖的架构,将大型视觉‑语言模型 GPT‑6 Astra 直接附着在 Unitree G1 四足机器人上。该整合跳过了传统的、单独训练的控制堆栈,而是依赖语言模型发出高层指令,这些指令通过可扩展的技能库转化为机器人动作。
HomeBody 的核心假设是,一个可替换的视觉‑语言模型即可充当物理代理的大脑。GPT‑6 Astra 接收机器人摄像头提供的视觉输入,解析场景后调用预编程技能目录——如抓取、导航和抽屉操作——来执行指令的行为。
探索与数字孪生创建
在任何清洁操作开始之前,Unitree G1 机器人会对厨房进行一次探索性扫描。在此阶段,它捕获 RGB 图像,在 Nvidia 的 Isaac Sim 中构建三维表示,并在专用记忆结构中记录物体身份与空间坐标。该数字孪生使机器人能够检索后续视线之外的物品,从而拥有持久的世界模型。
记忆系统特意设计为可被 GPT‑6 Astra 查询。当模型规划一系列动作——例如“把柜台上的红色杯子拿起放进洗碗机”——时,它可以引用已存储的位置,即使机器人已经移动且该杯子不再可见,也能定位并抓取。
语言驱动的规划与自我纠正
任务执行遵循闭环流程。语言模型接收高层指令如“清理厨房”,将其分解为子目标,并向技能库下达命令。如果某个动作失败——比如抽屉打不开——GPT‑6 Astra 通过视觉反馈检测错误,重新规划并尝试纠正性操作。
研究人员明确将这种自我纠正能力归因于模型对自身输出进行推理并在每一步后重新评估视觉状态的能力。整个测试过程中不需要外部监督或强化信号。
零样本导航基准的表现
为评估 GPT‑6 Astra 单独的导航能力,团队在 R2R‑CE 基准上进行测试——这是一项仅提供单目 RGB 图像的零样本具身导航测评。模型取得了 79% 的成功率,比此前报告的最佳零样本结果高出 13 个百分点,也超过了最高监督式结果的 6.9 分。
这些数据表明,语言模型能够在无需任务特定微调的情况下,将原始视觉流转换为导航决策。成功率衡量的是机器人在遵循模型规划后,能否在预设容差内到达目标位置。
- Astra 模型的延迟导致指令下发变慢。
- 机器人指尖舵机过热限制了长时间抓取。
- 高计算成本限制了在普通硬件上的实时部署。
- 在复杂布局中仍会出现路线偏离和狭窄通道失败。
尽管基准分数亮眼,评估仍揭示了反复出现的失效模式。机器人有时会偏离最优路径,难以通过狭窄走廊,且对是否已到达预定目标的判断出现错误。在超推理设置下记录了 21 起失败,许多情况下机器人与目标相距数米。
作者强调,这一基准仅限于 100 轮验证集。测试过程中未使用任何导航专用的微调、预构建地图或路径点预测模块。因此,报告的成功率反映的是未经优化的原始零样本能力,而非针对特定场景的调优系统。
HomeBody 的现场演示在单一、陌生的厨房环境中完成。机器人收到指令“清理厨房”,随后自主进行探索、绘图并操作物体。所有动作均由 GPT‑6 Astra 的规划和技能库驱动,未出现人为介入的纠正。
局限性与未解之问
实验中暴露出若干关键技术约束。通过外部 API 查询大型语言模型固有的延迟,在感知与执行之间产生显著的时间间隔。此外,Unitree G1 的指尖舵机在重复抓取时会出现热积累,系统必须暂停或降低抓力以防损坏。
计算需求同样构成障碍。同步运行 GPT‑6 Astra、Nvidia Isaac Sim 与技能执行引擎需要高端 GPU 与大量内存,这限制了在边缘设备或成本敏感场景中的可行性。
最后,评估范围仍然狭窄。100 轮验证集未覆盖厨房布局的全部多样性、物体种类或指令复杂度,真实部署时会面临更广泛的变化。作者呼吁在更多任务、更长导航路径以及多环境下进行更大规模的测试,以评估模型的泛化能力。
对组织的实际意义
对于考虑部署自主服务机器人的组织而言,HomeBody 展示了一条降低为每个新环境编写低层控制器工作量的路径。通过使用可替换的视觉‑语言模型,同一机器人平台理论上只需更新模型或扩展技能库,即可适配不同领域。
然而,当前的硬件与延迟限制意味着在繁忙场景下实现实时运行仍具挑战。企业必须评估运行 GPT‑6 Astra 所需的计算基础设施是否符合预算与延迟容忍度。
文中记录的失效模式也表明,安全关键的应用需要额外的防护措施,例如备用的导航规划器或实时监控系统,以缓解路线偏离并确保目标验证的可靠性。
总之,HomeBody 为大型视觉‑语言模型直接驱动具身代理在非结构化家庭空间中的可行性提供了有力的概念验证。该方法削减了对任务特定控制训练的依赖,但也带来了计算、热管理和鲁棒性方面的新工程挑战,组织在大规模采用前必须予以解决。



