Figure의 Helix 2.5, 30개의 새로운 집에서 제로샷 성공
Figure는 Helix 2.5 제어 모델이 현장 적응 없이도 30채의 완전히 새로운 집에서 거실 정리, 수건 접기, 침대 정리를 성공적으로 수행했으며, 전문 정책과 동일한 성공률을 보였다고 발표했습니다.

2026년 9월 17일, Figure는 인간형 서비스 로봇용 새로운 제어 아키텍처인 Helix 2.5를 공개했습니다. 보도 자료에서는 단일 모델을 훈련 세트에 전혀 포함되지 않은 30채의 가정에 배치한 현장 테스트를 강조했습니다.
테스트에서 로봇은 세 가지 일상 업무를 수행해야 했습니다: 거실 정리, 수건 한 세트 접기, 그리고 각 가정에 이미 존재하는 가구와 물건을 사용해 침대 만들기. 사전 매핑이나 물체 목록 작성은 전혀 이루어지지 않았습니다.
훈련 데이터와 평가 데이터의 엄격한 분리
Figure는 평가에 사용된 집들의 데이터가 훈련 파이프라인에 전혀 들어가지 않았다고 강조했습니다. 회사 엔지니어와 독립적인 인간 감사관이 테스트 중 관찰된 물체나 공간 배치가 Helix 2.5 훈련에 사용된 사양 데이터에 포함되지 않았음을 확인했습니다.
30개의 환경 모두에 단일 제어 체크포인트만 사용되었습니다. 로봇의 신경망 가중치는 미세 조정되지 않았으며, 초기 성과 결과에 기반한 선택 메커니즘도 적용되지 않았습니다.
목표‑특정 정책과의 성능 비교
Figure에 따르면 Helix 2.5는 목표 환경에서 직접 훈련된 Helix 02와 동일한 성공률을 달성했습니다. 주요 차이점은 Helix 2.5가 그 수준에 도달하기 위해 필요한 적응 데이터가 약 절반에 불과했다는 점입니다.
시스템은 또한 실시간 물리적 보정 능력을 보여주었습니다. 계획된 움직임이 침대 프레임에 충돌할 경우, 로봇은 뒤로 물러서고 자세를 바꾸거나 장애물을 우회한 뒤 접기 작업을 재개했습니다.
ABC Tecnología의 독립 평가
ABC Tecnología는 30채의 가정에서 전체 성공률이 56 %에 이른다고 보고했습니다. 현지 로봇 전문가들은 2분의 1에 가까운 실패율은 소비자용 가정 로봇으로서는 받아들일 수 없다고 경고했습니다.
Figure는 이번 테스트가 완전한 가정 자동화보다는 일반화 능력을 측정하기 위해 설계되었다고 답했습니다. 평가된 작업은 사전에 지정된 세 가지에 한정됐으며, 성공 기준도 사전에 정의되었습니다.
- 30채의 이전에 보지 못한 집
- 3가지 가정 업무(정리, 수건 접기, 침대 만들기)
- 단일 모델 체크포인트, 가중치 미세조정 없음
- ABC가 보고한 전체 성공률 56 %
- Helix 02 대비 절반 수준의 적응 데이터
회사는 또한 계산 투자 규모를 공개했습니다: Helix를 구동하는 Index 플랫폼은 초당 약 35분의 새로운 인간 수준 경험을 생성했으며, 모델 훈련에 총 35억 달러 규모의 컴퓨팅 자원이 투입되었습니다.
이 결과는 측정 가능한 제로샷 일반화를 보여주지만, 로봇이 이제 모든 가정 환경에서 완전 자율적으로 작동할 수 있다는 의미는 아닙니다. 테스트는 제한된 작업 집합과 사전 정의된 성공 지표에만 국한되었습니다.
Helix 2.5의 제로샷 성능을 검증하기 위해 수행된 현장 시험은, 모델이 사전에 보지 못한 가정 환경에서도 특정 작업을 수행할 수 있음을 보여주는 중요한 검증 단계였다. 이 과정에서 핵심적인 검증 요소는 훈련 데이터와 평가 데이터의 완전한 분리를 유지한 점이며, 이는 모델이 실제 상황에서 과적합 없이 일반화 능력을 발휘했는지를 판단하는 기준이 된다. 또한, 독립적인 인간 감사관이 물체와 배치의 일치 여부를 확인함으로써, 평가 과정이 외부 검증을 통해 신뢰성을 확보했다는 점이 강조된다.
테스트에 사용된 30채의 가정은 모두 사전 매핑이나 물체 목록 작성 없이 로봇에게 노출되었으며, 이는 로봇이 환경 인식을 실시간으로 수행해야 함을 의미한다. 이러한 제약 하에서 로봇은 거실 정리, 수건 접기, 침대 만들기라는 세 가지 작업을 수행했으며, 각 작업은 사전에 정의된 성공 기준에 따라 평가되었다. 성공 기준이 명확히 정의된 덕분에 결과 해석이 일관되게 이루어졌으며, 이는 향후 다른 환경에 대한 확장 가능성을 검증하는 데 중요한 기준이 된다.
Helix 2.5가 목표‑특정 정책인 Helix 02와 동등한 성공률을 달성했음에도 불구하고, 적응에 필요한 데이터 양이 절반 수준에 머물렀다는 점은 모델 효율성 측면에서 큰 의미를 가진다. 데이터 효율성이 향상되면 훈련 비용과 시간, 그리고 현장 재훈련에 필요한 인프라 투자가 크게 감소한다. 그러나 이 효율성은 제한된 작업 집합과 사전에 정의된 성공 지표에만 적용된다는 점에서, 보다 복합적인 가정 환경이나 예외 상황에 대한 일반화 능력은 아직 충분히 검증되지 않았다.
ABC Tecnología가 보고한 전체 성공률 56 %는 현 단계에서의 실용성을 가늠하는 중요한 지표이다. 반면, 약 절반에 해당하는 실패 사례는 로봇이 아직 완전한 자율성을 확보하지 못했음을 시사한다. 이러한 실패는 주로 물리적 충돌 회피, 물체 인식 오류, 혹은 작업 순서 최적화와 같은 세부적인 제어 문제에서 발생했을 가능성이 있다. 따라서 현장 배포 시 인간 감독이나 백업 메커니즘을 병행하는 것이 안전성을 보장하는 현실적인 접근 방식이다.
한국 기업이 서비스 로봇 도입을 고려할 때, Helix 2.5의 결과는 두 가지 실용적인 시사점을 제공한다. 첫째, 단일 모델만으로도 다양한 미지의 환경에 대응할 수 있다는 점은 초기 투자 비용과 배포 시간을 크게 절감할 수 있음을 의미한다. 둘째, 현재의 성공률은 아직 인간의 개입이 필요함을 보여주며, 이를 보완하기 위한 모니터링 시스템이나 원격 지원 체계가 필수적이다. 이러한 보완책을 마련함으로써 로봇 운영의 신뢰성을 높일 수 있다.
결론적으로, Helix 2.5의 제로샷 일반화 테스트는 모델의 잠재력을 입증했지만, 실제 가정에서의 완전 자율 운영을 보장하기에는 아직 한계가 존재한다. 향후 연구와 개발은 작업 범위 확대, 실패 원인 정밀 분석, 그리고 실시간 오류 복구 메커니즘 강화에 초점을 맞춰야 할 것이다. 이러한 방향성을 통해 로봇이 보다 다양하고 복잡한 가정 환경에서도 안정적으로 작동하도록 만드는 것이 궁극적인 목표가 될 것이다.
한국어 사용 기업이 서비스 로봇 도입을 고려한다면 두 가지 실용적인 시사점을 얻을 수 있습니다. 첫째, 잘 훈련된 단일 모델만으로도 비용이 많이 드는 현장 재훈련 없이 다양한 미지의 환경을 처리할 수 있어 배포 시간과 비용을 크게 절감할 수 있습니다. 둘째, 현재의 성공률은 실제 가정에서 신뢰할 수 있는 운영을 위해 인간 감독이나 백업 메커니즘이 여전히 필요함을 시사합니다.
출처
- Helix 2.5: Zero-Shot 30-Home GeneralizationFigure · 2026년 9월 17일
- Un robot humanoide entra en 30 casas que nunca había visto y empieza a hacer las tareas por sí mismoABC Tecnología · 2026년 9월 18일



