李飛飛World Labs推出世界模型Atlas,鎖定空間智慧
李飛飛創立的World Labs於9月1日發表新一代世界模型Atlas,可從單張照片重建3D場景,同時模擬空間與時間,服務創作與機器人訓練。

由史丹佛大學教授、AI先驅李飛飛(Fei-Fei Li)創立的新創公司World Labs,於9月1日發表新一代世界模型Atlas。開發團隊從頭對其進行預訓練,讓它能原生處理文字、圖像、影像及3D內容,並表示Atlas僅需一張照片就能重建真實世界的3D場景,可生成長達一分鐘、具備精準相機控制的高解析度影片,也能產生機器人在模擬環境中訓練所需的深度資料。李飛飛將這次發表視為World Labs的里程碑式成果,指出Atlas為從視覺特效到機器人的眾多應用場景打開了大門。
Atlas究竟能做到哪些事
- 相機控制生成:僅需一至六張參考圖像,Atlas便能生成具備像素級精準相機控制的影片,最長可輸出一分鐘、1440p解析度的影片。
- 空間重建:輸入一張到數十張,有時甚至超過百張圖像,Atlas既能生成全新視角的圖像影格,也能產出點雲與3D高斯潑濺等明確的3D輸出成果,實際表現可勝過專門針對3D重建訓練的頂尖模型。
- 時空模擬:僅憑幾支手機拍攝的普通影片,Atlas便能凍結畫面並從不可能的角度重新構圖,同時支援「真實到模擬」的工作流程,讓機器人在生成的環境中訓練與測試。
- 圖像生成:Atlas能自文字生成圖像和360度全景圖,可遵循複雜的提示詞、渲染文字,並產生各式各樣的視覺風格。
在技術架構上,Atlas是開發團隊所稱的多模態自回歸擴散轉換器(multimodal autoregressive diffusion transformer),從零開始預訓練,而非在既有的影片或語言模型上改造而成。文字、圖像、相機姿態、3D深度圖等每一種輸入,都會被錨定在一個共享空間脈絡中的特定位置,Atlas便以此脈絡中已存在的一切內容為條件,生成接下來的輸出;例如兩張毫無關聯的參考圖像,只要分別指定它們在3D空間中的位置,Atlas就能將兩者縫合成一個空間自然、連貫的世界。這使Atlas有別於OpenAI的Sora等仰賴不精確文字提示來控制相機角度和動作的早期視訊生成器:Atlas將相機軌跡與場景幾何作為原生輸入,得以展現文字提示無法提供的逐格精準控制。開發團隊表示,隨著訓練資源持續增加,Atlas的效能表現隨之提升,預期此一趨勢會延續下去。
押注機器人,不只是視覺特效
這次發表延續了World Labs今年以來的布局。今年6月,李飛飛提出一套框架,將世界模型分為渲染器、模擬器與規劃器三類,並明確指出模擬器最為關鍵,因為它承載著渲染與行動共同依賴的幾何、物理和動力學基礎。7月21日,World Labs收購了機器人模擬新創公司SceniX;一週後的7月28日,公司公開了「真實到模擬、再到真實」系統,強調機器人領域最大的瓶頸在於缺乏廉價、可控、可規模化的訓練經驗。Atlas正是串起這些布局的關鍵:它能將普通照片或影片轉化為3D空間,再轉化為機器人訓練所需的感測器視角與可變化的模擬環境。World Labs已展示了一些令人驚豔的測試案例,並表示Atlas在創意視覺效果和遊戲設計方面亦有成果,然而開發團隊坦言,真正的目標是為訓練機器人建立準確的模擬,這也是Atlas在競爭激烈的世界模型市場中脫穎而出的關鍵。
世界模型能生成、重建並模擬任何可能存在的世界,理解各種世界的樣貌、行為方式及演變過程,可為創作型使用者渲染想像中的世界,高度模擬真實世界,也能協助機器人規劃各項行動。
World Labs表示,Atlas目前正分階段開放,先向部分合作夥伴提供早期存取權限,其餘使用者可於官網申請存取。公司將Atlas定位為未來版Marble以及其他產品線的底層模型。對台灣的AI團隊、遊戲與視效工作室,以及在機器人與硬體供應鏈上耕耘已久的業者而言,實際的改變在於取得可用3D資料的成本大幅降低:過去需要昂貴的擷取設備或數月的專業3D重建工作,如今幾張普通照片或一段手機影片,就足以成為打造模擬環境、遊戲關卡或機器人訓練場的起點——前提是當更多業者能實際測試Atlas之後,這些早期成果依然能站得住腳。
資料來源
- Atlas: A World Model for Spatial IntelligenceWorld Labs · 2026年9月1日
- 李飞飞发布:全球首个多模态世界模型量子位 (QbitAI) · 2026年9月2日
- 李飛飛推出新一代世界模型 Atlas,模擬真實世界和機器人運作TechNews 科技新報 · 2026年9月2日



