Nota 將機器人 VLA 推論放上 Qualcomm 邊緣 NPU
Nota 表示,其最佳化機器人模型完全在 Qualcomm Dragonwing NPU 上執行,將一項移動方塊示範從 36 秒縮短至 12 秒。

南韓 AI 最佳化公司 Nota 於 9 月 22 日宣布,已將一個視覺語言動作機器人模型完全運行在 Qualcomm 的 Dragonwing IQ-9075 NPU 上,未使用 GPU,也未使用外部伺服器。這項由公司回報的示範,核心是一支機器手臂回應語音指令並移動一個方塊。在該測試中,Nota 表示任務時間從原始配置的 36 秒降至最佳化後的 12 秒,而任務成功率回報為 92%,最佳化前則為 93%。
Nota 稱改變了什麼
這項宣布屬於企業揭露,並非經獨立驗證的基準測試。Nota 表示,這項變化不只是更換硬體,而是一項最佳化工作,使機器人 AI 工作負載適合在邊緣 NPU 上執行。該公司列出數種方法:模型壓縮、NPU 圖最佳化、使用多個 NPU 單元,以及動作加速。Nota 將這些變更合併描述為讓 VLA 模型能在 Qualcomm 處理器上本機執行,而不是依賴 GPU 或機器人系統外部的伺服器。
這項實務差異有其重要性,因為視覺語言動作模型必須連接感知、語言理解與實體移動。在 Nota 描述的示範中,機器手臂必須解讀移動方塊的語音指令,並將其轉換為一串動作。因此,所回報的改善是針對端到端示範任務,而不只是單一孤立的神經網路運算。從 36 秒縮短至 12 秒,代表在該特定設定中,從指令到完成移動的週期變短。
Nota 也回報,最佳化後推論速度最高提升至 7 倍。這個數字應與示範任務時間縮短至三分之一分開解讀。推論速度指的是模型運算,而機器手臂任務還包含指令處理、感知與動作執行等其他階段。這兩項測量指向相同方向,但描述的不是同一件事。該公司的主張是,最佳化讓模型執行改善到足以實質縮短機器人動作流程。
最佳化配置如何運作
已驗證資訊並未提供模型大小、機器人硬體細節、方塊排列方式、除了移動方塊任務之外的指令措辭,或原始系統架構。可以確認的是,Nota 將 VLA 工作負載移至 Qualcomm Dragonwing IQ-9075 NPU,並避開 GPU 執行與外部伺服器處理。這意味著該示範以裝置端推論為框架:機器人 AI 任務所需的運算,由邊緣加速器在本機處理,而不是送往遠端處理。
模型壓縮是 Nota 表示採用的方法之一。一般而言,壓縮會降低模型的運算負擔,使其能在較嚴格的處理與記憶體限制內運作。在這個案例中,相關主張不是單靠壓縮就產生結果,而是壓縮構成較廣泛最佳化流程的一部分。由於沒有提供額外技術參數,無法量化從 36 秒降至 12 秒的改善中,有多少來自壓縮,又有多少來自其他變更。
NPU 圖最佳化是另一個被提及的組成部分。這指的是將模型的計算圖調整給目標神經處理硬體。對邊緣 NPU 而言,這可能很重要,因為效能不只取決於模型理論上的大小,也取決於運算如何排列,以及加速器如何支援這些運算。Nota 的宣布將結果歸因於這類具硬體意識的最佳化,其中包括使用多個 NPU 單元。該公司也提到動作加速,將推論改善連接到機器人的移動流程。
根據所提供事實,這項結果於 9 月 11 日在 KRAIN 展示。這個場景使相關數字屬於示範結果,而不是跨多種環境的廣泛評估。該公司回報,最佳化後任務成功率為 92%,最佳化前為 93%。依照回報,一個百分點的差異顯示,該示範中的速度改善並未伴隨此成功率指標的大幅下降。不過,在沒有試驗次數、測試條件或失敗定義的情況下,無法確認這項差異的統計意義。
這些數字能證明什麼,不能證明什麼
最有支撐的結論是,Nota 回報在 Qualcomm Dragonwing IQ-9075 NPU 上成功完成 VLA 機器人模型的裝置端示範,且所展示的移動方塊任務以先前時間的三分之一完成。該宣布也支撐較窄的說法,即該公司在自身最佳化配置中測得最高 7 倍的更快推論。這些是來自示範的公司回報效能數字,不是獨立實驗室測量,也不是具公開可重現條件的公共基準套件。
這些數字不能證明每一種 VLA 機器人工作負載都會在同一個 NPU 上看到相同加速。它們也不能證明最佳化系統在更多樣的任務、不同物件、不同指令或操作環境中,仍能維持 92% 成功率。已驗證事實不包含與其他邊緣處理器、GPU、伺服器式系統或競爭最佳化平台的比較。因此,這項宣布可被分析為 Nota 特定實作的證據,但不能視為機器人 AI 硬體或軟體的一般排名。
所提供資料也未完整描述原始 36 秒配置。因此,尚不清楚原始設定是否使用相同邊緣硬體但未最佳化、不同執行路徑,或另一種配置。這限制了對前後比較可解讀的範圍。Nota 描述的核心變化,是在不使用外部運算的情況下,將模型最佳化後在 Qualcomm NPU 上執行。該公司回報的實務結果,是更快完成移動方塊的語音指令。
實務意涵
對機器人而言,這類方法的實務意涵,是降低一類 AI 驅動控制任務對遠端運算的依賴。如果機器人能在本機處理 VLA 模型,系統設計就能避免把該步驟的推論送到外部伺服器。已驗證事實未提供功耗、延遲拆解、熱行為或成本測量,因此這些因素在此無法評估。即便如此,這項示範回應了一個明確工程問題:機器人 AI 模型是否能被調整到適合邊緣 NPU 資源並在其上執行。
改在邊緣 NPU 而非 GPU 上執行,也可能與部署限制有關,但該宣布沒有量化這些限制。它沒有說明電池影響、機殼需求或整體系統物料成本。可支撐的相關重點較窄:Nota 表示,其最佳化方法讓模型能在 Qualcomm Dragonwing IQ-9075 NPU 上執行,並使示範任務完成得更快,同時在回報結果中讓任務成功率幾乎不變。
Nota 在此事件中的定位,也是一家最佳化公司,而非機器人製造商本身。該公司於 2015 年在 KAIST 創立,推廣 NetsPresso 最佳化平台,並於 2025 年 11 月在 KOSDAQ 上市。這項背景使該宣布被定位為最佳化技術應用於機器人 AI 的展示。因此,這項示範不僅關於機器手臂可見的移動,也關於如何將要求較高的 VLA 工作負載調整到邊緣硬體上。
這項宣布仍留下重要問題,包括最佳化如何影響泛化能力、系統在更複雜任務中的表現,以及結果在示範情境之外的可重複性。即使如此,在公司回報資料的限制內,這個案例仍具有技術意義:Nota 表示,它把一個 VLA 機器人模型移上 Qualcomm 邊緣 NPU,在該設定中移除對 GPU 或外部伺服器的需求,並將一項特定語音移動方塊任務從 36 秒縮短至 12 秒。
資料來源
- Nota runs robot AI on Qualcomm NPU, tripling robot-arm speedSeoul Economic Daily · 2026年9月22日
- Nota demonstrates on-device robot AI with Qualcomm NPUBigGo Finance · 2026年9月22日



