Reka 推出 Rho‑1:19 億參數全能模型 同時處理文字、影像、影片與機器人控制
2026 年 10 月 5 日,Reka AI 公布 Rho‑1,一個擁有 190 億參數的單一模型,能在同一 token 流中處理文字、圖片、影片、推理與機器人指令,並承諾即時影片生成與直接機器人控制。

Reka AI 於 2026 年 10 月 5 日舉行的線上發表會首次揭露其最新的全能模型 Rho‑1,該模型擁有 190 億參數,從零開始自行訓練,旨在同時支援文字、圖像、影片、邏輯推理以及機器人指令等多模態任務。
與目前市場上多數 AI 系統採用多個專門模型分工合作的架構不同,Rho‑1 採用統一的 token 流將所有輸入與輸出編碼為共享的表示,並在單一的上下文窗口內處理,從而省去獨立的視覺、語言或控制管線。
統一的 token 表徵
Reka 說明,文字段落、圖像區塊、影片畫格以及機器人控制指令皆會先轉換成相同格式的 token,然後交由同一個神經網路進行運算。共享的上下文使得模型能夠保留先前交互的資訊,因而在多輪迭代中對影像或影片進行即時修改,而無需重新初始化狀態。
公司聲稱,Rho‑1 的基礎版以 0.79 倍實時速度生成影片,從收到請求到影片開始播放的總延遲約為六秒。內部測試顯示,一個蒸餾版本將生成流程壓縮至八步,能在約一秒內產出長度 5.3 秒的剪輯,儘管這些數據尚未經第三方驗證。
效能與訓練細節
根據 The Decoder 的報導,Rho‑1 的訓練持續約三個月,使用了 320 顆 Nvidia H100 GPU,計算資源投入相當龐大,顯示出將多模態堆疊壓縮成單一架構的雄心。Reka 把此視為向「單模型感知、理解與行動」目標邁進的重要一步。
模型在多輪次生成、編輯與比較視覺媒體方面的能力被視為關鍵差異化特點。使用者可以要求一系列細部調整,例如改變光線、加入新物件或變更運動軌跡,模型同時保有場景內部的一致性表徵。
同一權重驅動機器人控制
Reka 亦示範,同一組權重可直接用於機器人控制。逆向動力學模組將公開的網路影片轉換為驅動機械臂的指令信號,說明視覺學習可以無縫映射到運動行為,無需額外的控制模組。
- 190 億參數於單一網路中
- 從頭訓練,三個月、320 顆 H100 GPU
- 統一 token 流涵蓋文字、圖像、影片與機器人指令
- 基礎版以 0.79 倍實時速度生成影片,啟動約 6 秒
- 蒸餾八步變體聲稱 5.3 秒剪輯約 1 秒產出
此公告將 Rho‑1 定位為「全能模型」的概念驗證,強調它能在感知、語言與行動之間流暢切換。透過壓縮傳統的多模態管線,公司認為開發週期可縮短,系統整合的複雜度亦能降低。
批評者指出,尤其是蒸餾變體的效能聲稱尚未經第三方測試驗證。獨立基準測試將是確認 Rho‑1 是否真的在速度與品質上優於專門模型的關鍵。
對中文使用者的意涵
對於在華語市場運營的企業而言,Rho‑1 有望簡化 AI 基礎建設,取代多套獨立模型成為單一服務。內容創作者可更快完成迭代式影片製作,行銷團隊能即時生成多模態素材,製造業者則可嘗試視覺導向的機器人控制,無需自行訓練專屬控制網路。統一的 token 方法亦有助於提升跨模態推理的一致性,減少因不同系統拼接而產生的錯誤。
在台灣與大中華區的應用情境中,Rho‑1 的即時影片生成與機器人指令功能特別受到智慧製造與數位內容產業的關注,預期將促進本地 AI 服務供應商的競爭與合作。
資料來源
- Rho-1: collapsing the multimodal stackReka AI · 2026年10月5日
- Reka AIs Omni-Modell Rho-1 vereint Text, Bild, Video und RobotersteuerungThe Decoder · 2026年10月5日



