Figure Helix 2.5 在三十個全新住宅中實現零樣本成功
Figure 展示其 Helix 2.5 控制模型能在三十個全新住宅中整理客廳、摺疊毛巾、鋪床,未做任何現場調整,即達到專門策略的表現且只使用一半的適應資料。

2026年9月17日,Figure 正式發布了其最新的類人服務機器人控制架構——Helix 2.5,並在同一天的新聞稿中公布了一項大規模的實地測試結果。這項測試的核心在於,僅使用單一的模型即在三十個全新、未曾出現在任何訓練資料庫中的住宅內完成指定的家務任務,且未對每個住宅進行任何事先的映射或物件目錄化作業。
測試設計要求機器人在每個住宅內執行三項日常家務:先將客廳區域的雜物整理整齊,接著摺疊一套預先放置的毛巾,最後利用住宅內現有的床架與床單完成鋪床動作。這三項任務在測試前均未經過任何形式的現場校正或特別調整,完全依賴模型的零樣本泛化能力。
嚴格分離訓練與評估資料
Figure 強調,測試所用的三十個住宅之任何空間布局、家具擺放或物件特徵,都未曾出現在 Helix 2.5 的訓練資料中。為確保資料分離的徹底性,公司工程師與獨立的人類稽核員共同檢視,確認所有觀測到的環境資訊均屬於全新領域。
在整個測試過程中,所有三十個住宅均僅使用同一個模型檢查點,該模型的神經網路權重在部署前未進行任何微調,也未根據早期表現結果套用選擇或適配機制。
與目標特定策略的表現比較
Figure 表示,Helix 2.5 在這三十個全新住宅中的成功率與先前在目標環境中直接訓練的 Helix 02 相當,唯一的差異在於 Helix 2.5 只需使用約一半的適應資料即可達到相同的表現水準。
測試同時展示了即時的物理校正功能:當機器人在鋪床過程中預測到與床架可能發生碰撞時,會自動退後、改變姿勢或繞過障礙,然後重新執行摺疊與鋪床的程序,確保動作的安全與連續性。
ABC Tecnología 的獨立評估
根據西班牙媒體 ABC Tecnología 的報告,三十個住宅的原始成功率為 56%。該報告引用了本地機器人專家的意見,指出接近一半的失敗率對於面向消費者的家庭助理而言仍屬不可接受。
Figure 回應稱,此次測試的主要目的是衡量模型的泛化能力,而非驗證完整的家居自主性。測試僅聚焦於三項預先指定的任務,且成功與否的判定標準在測試開始前已明確定義。
- 30 個全新住宅
- 3 項家務(整理客廳、摺疊毛巾、鋪床)
- 單一模型檢查點,未進行權重調整
- ABC 報告的 56% 整體成功率
- 相較 Helix 02 使用一半的適應資料
Figure 亦透露,支援 Helix 系列的 Index 計算平台每秒可產生約相當於 35 分鐘的人類等級體驗,整體訓練過程耗資約 35 億美元的運算資源,以確保模型在多樣化環境中的表現穩定。
儘管測試結果證實了零樣本泛化的可行性,但這並不意味著機器人已能在任何家庭環境中完全自主運作。測試範圍仍受限於三項特定任務與事先設定的成功指標,實際應用時仍需考量更廣泛的家務需求與環境變數。
對於計畫部署類人服務機器人的華語企業與機構而言,這些發現提供了兩項關鍵的實務啟示:其一,單一、訓練良好的模型即可應對多種未見環境,顯著降低現場再訓練的成本與時間;其二,當前的成功率仍不足以完全取代人類監督,必須配備備援機制以確保在真實住宅中的可靠運作。
最後,Figure 呼籲業界持續關注零樣本泛化的研究方向,同時強調在推向市場前,必須結合更嚴格的安全驗證與使用者體驗測試,以確保類人機器人在家庭中的實際效能與接受度。
資料來源
- Helix 2.5: Zero-Shot 30-Home GeneralizationFigure · 2026年9月17日
- Un robot humanoide entra en 30 casas que nunca había visto y empieza a hacer las tareas por sí mismoABC Tecnología · 2026年9月18日



