HomeBody 시스템, GPT‑6 Astra와 Unitree G1 로봇을 연결해 낯선 주방을 자율 청소
스탠포드와 캘리포니아 공대 연구진이 GPT‑6 Astra와 Unitree G1 로봇을 직접 결합한 HomeBody를 시연, 사전 훈련된 제어 계층 없이 낯선 주방을 탐색·맵핑·청소합니다.

스탠포드 대학교와 캘리포니아 공과대학(Caltech) 연구진은 HomeBody라는 새로운 아키텍처를 발표했습니다. 이 시스템은 대형 비전‑언어 모델인 GPT‑6 Astra를 Unitree G1 사족보행 로봇에 직접 연결합니다. 기존에 별도로 훈련된 제어 스택을 우회하고, 언어 모델이 고수준 명령을 내리면 확장 가능한 스킬 라이브러리를 통해 로봇 행동으로 변환됩니다.
HomeBody의 핵심 전제는 교체 가능한 단일 비전‑언어 모델이 물리적 에이전트의 두뇌 역할을 할 수 있다는 것입니다. GPT‑6 Astra는 로봇 카메라의 시각 입력을 받아 장면을 해석하고, 사전 프로그래밍된 스킬 카탈로그(예: 물건 집기, 내비게이션, 서랍 조작)를 호출해 지시된 행동을 수행합니다.
탐색 및 디지털 트윈 생성
청소 작업이 시작되기 전에 Unitree G1 로봇은 주방을 탐색하며 스윕합니다. 이 단계에서 로봇은 RGB 이미지를 캡처하고 Nvidia의 Isaac Sim 안에서 3차원 모델을 구축하며, 객체 식별과 공간 좌표를 전용 메모리 구조에 기록합니다. 이 디지털 트윈은 로봇이 나중에 시야에서 벗어난 물건을 찾아낼 수 있게 해 주며, 지속적인 세계 모델을 제공합니다.
메모리 시스템은 GPT‑6 Astra가 쿼리할 수 있도록 설계되었습니다. 모델이 “카운터에 있는 빨간 머그컵을 집어 식기세척기에 넣어라”와 같은 행동 순서를 계획할 때, 로봇이 이동해 물체가 보이지 않게 되더라도 저장된 위치 정보를 참고해 머그컵을 찾을 수 있습니다.
언어‑구동 계획 및 자기 교정
작업 실행은 폐쇄 루프 프로세스로 진행됩니다. 언어 모델은 “주방을 청소해라”와 같은 고수준 명령을 받고 이를 하위 목표로 분해한 뒤 스킬 라이브러리에 명령을 전달합니다. 만약 서랍이 열리지 않는 등 행동이 실패하면, GPT‑6 Astra는 시각 피드백을 통해 오류를 감지하고 계획을 수정해 교정 동작을 시도합니다.
연구진은 이러한 자기 교정 능력을 모델이 자체 출력에 대해 추론하고 각 단계 후 시각 상태를 재평가할 수 있기 때문이라고 명시했습니다. 테스트 실행 동안 외부 감독이나 강화 신호는 전혀 필요하지 않았습니다.
제로샷 내비게이션 벤치마크 성능
GPT‑6 Astra의 순수 내비게이션 역량을 평가하기 위해 팀은 R2R‑CE 벤치마크를 사용했습니다. 이 제로샷 구현형 내비게이션 테스트는 단일 모노큘러 RGB 이미지만 제공합니다. 모델은 79 %의 성공률을 기록했으며, 기존 최고 제로샷 결과보다 13 퍼센트포인트, 최고 감독 학습 결과보다 6.9 포인트 높은 수치였습니다.
이 결과는 언어 모델이 별도 과제 특화 파인튜닝 없이도 원시 시각 스트림을 내비게이션 결정으로 변환할 수 있음을 보여줍니다. 성공 지표는 모델이 제시한 계획에 따라 로봇이 사전 정의된 허용 오차 내에서 목표 지점에 도달했는지를 나타냅니다.
- Astra 모델의 지연으로 명령 발행 속도가 느려집니다.
- 로봇 손가락 서보의 과열이 장시간 물건 집기를 제한합니다.
- 높은 연산 비용으로 저사양 하드웨어에서는 실시간 배포가 어렵습니다.
- 복잡한 레이아웃에서는 경로 이탈 및 좁은 통로 통과 실패가 지속됩니다.
강력한 벤치마크 수치에도 불구하고 평가에서는 반복적인 실패 모드가 드러났습니다. 로봇은 때때로 최적 경로에서 벗어나 좁은 복도를 통과하는 데 어려움을 겪었으며, 목표에 도달했는지 여부를 오판했습니다. 벤치마크의 초고도 추론 설정에서 총 21건의 실패가 기록됐으며, 그 중 다수는 로봇이 목표 지점에서 수 미터 떨어진 위치에 머물렀습니다.
저자들은 이 벤치마크가 100회 에피소드 검증 세트에 한정됐으며, 내비게이션 전용 파인튜닝, 사전 구축 지도, 웨이포인트 예측 모듈을 전혀 사용하지 않았다고 강조합니다. 따라서 보고된 성공률은 최적화된 시스템이 아니라 순수 제로샷 능력을 반영합니다.
HomeBody 시연 자체는 단일, 낯선 주방 환경에서 진행되었습니다. 로봇은 “주방을 청소해라”라는 명령을 받고 스스로 탐색·맵핑·물체 조작을 수행했습니다. 모든 행동은 GPT‑6 Astra의 계획과 스킬 라이브러리에 의해 구동되었으며, 인간이 개입하는 교정은 없었습니다.
제한 사항 및 남은 질문
실험에서 드러난 주요 기술적 제약은 다음과 같습니다. 외부 API를 통한 대형 언어 모델 호출 시 발생하는 지연은 인지와 행동 사이에 눈에 띄는 지연을 초래합니다. 또한 Unitree G1의 손가락 서보는 반복적인 집기 동작 중 열이 축적돼, 시스템이 손상 방지를 위해 일시 정지하거나 그립 힘을 감소시켜야 했습니다.
연산 요구량 또한 큰 장벽입니다. GPT‑6 Astra와 Nvidia Isaac Sim, 스킬 실행 엔진을 동시에 구동하려면 고성능 GPU와 대용량 메모리가 필요합니다. 이는 HomeBody를 엣지 디바이스나 비용에 민감한 환경에 배치하는 것을 어렵게 만듭니다.
마지막으로 평가 범위가 제한적이라는 점입니다. 100회 검증 세트는 실제 현장에서 마주할 다양한 주방 레이아웃, 물체 종류, 복합 명령을 충분히 포괄하지 못합니다. 저자들은 더 다양한 과제, 긴 내비게이션 경로, 다중 환경에 걸친 광범위 테스트를 통해 일반화 능력을 검증할 것을 촉구합니다.
조직을 위한 실용적 함의
자율 서비스 로봇을 도입하려는 조직에 HomeBody는 새로운 환경마다 저수준 제어기를 별도 프로그래밍해야 하는 공학적 부담을 크게 낮출 수 있는 길을 제시합니다. 비전‑언어 모델만 교체하면, 단일 로봇 플랫폼이 모델 교체나 스킬 라이브러리 확장만으로도 다양한 도메인에 적응할 수 있습니다.
하지만 현재 하드웨어와 지연 제한으로 인해 복잡하고 바쁜 현장에서 실시간 운영은 여전히 도전 과제입니다. 기업은 GPT‑6 Astra를 대규모로 운영하기 위해 필요한 컴퓨팅 인프라가 예산 및 지연 허용 범위에 부합하는지 신중히 평가해야 합니다.
문서화된 실패 모드는 안전‑중요 응용 분야에서 추가적인 보호 장치가 필요함을 시사합니다. 예를 들어, 백업 내비게이션 플래너나 실시간 모니터링 시스템을 도입해 경로 이탈을 완화하고 목표 검증을 확실히 해야 합니다.
요약하면, HomeBody는 대형 비전‑언어 모델이 비구조적 가정용 공간에서 직접 로봇을 구동할 수 있음을 입증한 설득력 있는 개념 증명입니다. 이 접근법은 과제‑특화 제어 훈련 의존성을 줄이지만, 연산량, 열 관리, 견고성 등 새로운 엔지니어링 과제를 동반합니다. 조직이 대규모 채택을 고려하려면 이러한 도전을 충분히 해결해야 합니다.



