DeepSeek 與華為發布開源工具,支援 Ascend 950 程式設計,降低對 CUDA 的依賴
2026 年 9 月 30 日,DeepSeek 在華為的支援下,公開了一套針對 Ascend 950 加速器的開源函式庫,旨在為 Nvidia 的 CUDA 基礎設施提供替代方案。

DeepSeek 於 2026 年 9 月 30 日宣布,公開發布多款開源程式設計工具,這些工具是與華為合作開發的,專門針對 Ascend 950 加速器。此舉被定位為一項策略性舉措,旨在降低開發者僅依賴 Nvidia CUDA 生態系統所帶來的摩擦,同時為人工智慧社群提供更多硬體選擇的可能性。
人工智慧生態系統的背景
多年以來,CUDA 已成為大規模模型訓練與推論的標準平台,這得益於其成熟度、豐富的最佳化函式庫以及 Nvidia GPU 在資料中心的廣泛部署。這種主導地位形成了一種結構性依賴,使得即使替代架構在成本或能源效率上具備優勢,也難以被廣泛採用。開發者因此常被鎖定在單一供應商的生態系統中,限制了彈性與嘗試新硬體的空間。
DeepSeek 與華為的新工具
DeepGEMM-Ascend 是首批發布的函式庫之一。它是一層矩陣乘法函式庫,支援 BF16、FP8 與 FP4 精度運算,並保持與原始 DeepGEMM 相同的介面,方便已使用 DeepGEMM 的使用者進行遷移。其設計目標是讓開發者只需進行最小的程式碼變更,就能利用 Ascend 950 晶片的架構完成訓練與推論任務。
- BF16
- FP8
- FP4
DeepEP-Ascend 與 DeepGEMM 形成互補,負責分散式訓練與大規模推論過程中的裝置間通訊。該函式庫提供了 mixture‑of‑experts(專家混合)模型的路由例程,這是一種將模型的不同部分分配到不同晶片上以提升效率的技術。根據兩家公司發布的聲明,這一解決方案能無縫整合到常用的 PyTorch 與 TensorFlow 工作流程中。
華為的高階語言 TileLang 在此次發布中獲得了對 Ascend 950 的原生支援。此擴充實現了程式碼的自動產生、任務的自動排程以及操作的同步,從而大幅降低了針對特定硬體進行手動最佳化的工作量。TileLang 的跨平台特性表明,使用者仍可在不拋棄 Nvidia 的情況下繼續使用其他架構,儘管此發布並不暗示性能等價。
架構與 128 晶片超級節點測試
為驗證新函式庫的效能,DeepSeek 與華為在一個由 128 塊 Ascend 950 組成的超級節點上進行了測試。結果顯示,當 DeepGEMM‑Ascend 與 DeepEP‑Ascend 同時使用時,計算效能與通訊效能皆有所提升,這得益於與華為 CANN 平台的深度整合,後者負責硬體層面的資源分配與任務編排。
儘管取得了進展,官方聲明仍明確指出,此次發布並不等同於完全拋棄 Nvidia,也未能實現與 CUDA 效能的平價。CUDA 生態系統的成熟度仍是其競爭優勢,已公布的基準測試並未涵蓋所有工作負載類型與網路配置。因此,各組織在採用 Ascend 950 時仍需進行針對性的評估,以確認其是否滿足特定需求。
對拉美地區開發者與資料中心的影響
對於該地區的人工智慧開發團隊而言,DeepGEMM‑Ascend、DeepEP‑Ascend 以及 TileLang 的支援,為在不拋棄基於 PyTorch 或 TensorFlow 工作流程的前提下嘗試替代硬體提供了可能。已擁有華為基礎設施的資料中心現在可以使用更完整的軟體堆疊,這可能帶來更低的授權成本以及供應商的多元化。
在實務操作中,決定試用 Ascend 950 加速器的組織需要審查其訓練流水線,以整合新函式庫、調整分散式通訊腳本,並在自有資料集上驗證效能。華為預計在 2027 年實現其系統在訓練中的廣泛使用,這暗示支援與文件將持續完善,從而協助在未來數年內採用該解決方案的使用者更順利完成遷移。
資料來源
- DeepSeek y Huawei se alían para reducir la dependencia de NvidiaExpansión · 2026年9月30日
- DeepSeek and Huawei release open-source Ascend AI programming toolsTom's Hardware · 2026年10月1日



