AI-translated from English; not yet reviewed by a fluent editor.

# DeepSeek 發布適用於華為 Ascend 950 的 DeepGEMM 核心

> DeepSeek 新推出的 Ascend 950 核心程式庫提供熟悉的 DeepGEMM 介面與原始碼。其先決條件與自行公布的基準測試，界定了開發者評估時應注意的範圍。

By BIG CHANGE Editorial

Published: 2026-09-30T17:47:47.035Z
Updated: 2026-09-30T17:47:47.035Z
Canonical: https://bigchange.ai/blog/deepseek-deepgemm-ascend-950-kernels

![Conceptual charcoal illustration of a generic rackmount computer chassis in an open test rack, seen from behind with two cables routed down the frame.](https://bigchange.ai/api/media/file/deepgemm-ascend-evaluation-rack-hero-v2.png)
AI-generated by OpenAI; BIG CHANGE conceptual editorial illustration.

DeepSeek 已為使用華為 950 系列 NPU 的開發者發布 [Ascend 版 DeepGEMM 核心程式庫](https://github.com/deepseek-ai/DeepGEMM-Ascend)。儲存庫 README 將初次發布日期列為 2026 年 9 月 30 日；Python 套件標示版本為 0.1.0。它為團隊在該硬體上進行矩陣乘法及相關模型運算，提供開放原始碼的起點。目前公布的效能數據來自 DeepSeek 自行測試。

對評估 Ascend 軟體堆疊的工程師而言，這次發布提供核心原始碼、熟悉的 DeepGEMM 入口，以及有文件說明的擴充模組建置方式。完整模型效能與營運成本仍須在預定系統上依實際工作負載測試。

## 此次發布包含哪些內容

DeepGEMM 是一個用於 AI 模型常見矩陣運算的程式庫。[Ascend README](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/main/README.md)列出 BF16、FP8 與 FP4 GEMM 核心、混合專家模型的分組運算、MQA logits、融合式 MegaMoE 運算，以及 mHC prenorm 核心。其[Python 套件匯出項目](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py)展示密集與分組 GEMM 函式、MQA 函式、縮放因子布局輔助工具，以及 JIT 編譯和 AI core 使用控制項。此儲存庫採用 MIT 授權。

DeepSeek 表示，Ascend 移植版與其[上游 DeepGEMM](https://github.com/deepseek-ai/DeepGEMM#interfaces)完全 API 相容。相同的`deep_gemm` 套件名稱與大部分公開介面可能有助於程式碼移植，但 README 指出一項重要的資料布局差異：Ascend 會將沿 K 維度的每一對 UE8M0 縮放因子打包為 `int16`，並以 MN-major 順序儲存打包後的值。套件匯出的函式可將縮放因子轉換成所需布局。使用量化輸入的應用程式仍須提供合適資料並驗證自身結果；相容性說法是維護者的主張，並非 BIG CHANGE 執行的移植測試。

## 開發者試用所需條件

其[文件列出的需求](https://github.com/deepseek-ai/DeepGEMM-Ascend#requirements)包括 Ascend NPU、搭配 `bisheng` 與 `ld.lld` 工具的 CANN 9.20、`torch_npu`、Python 3.10 或更新版本，以及支援 C++20 `<format>`的編譯器和標準程式庫。維護者表示，開發與驗證是在 Ascend 950 系列上進行。`tilelang` 被列為 HC prenorm 核心的套件相依項目；`tree-sitter` 與 `tree-sitter-cpp` 則是從原始碼建置時產生型別存根所需的工具。README 未指定`torch_npu` 版本，也未證明已在其他 Ascend 裝置上完成驗證。

README 指示開發者連同子模組複製儲存庫，再透過 `develop.sh`建置 C++ 擴充模組，或從已複製的原始碼使用 `pip install . --no-build-isolation`安裝。其[建置設定](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/setup.py)會匯入`torch` 與 `torch_npu`，透過`ASCEND_HOME_PATH` 或 `ASCEND_TOOLKIT_HOME`尋找 Ascend 工具套件，並連結 Ascend 與 Torch NPU 程式庫。因此，評估這些核心需要相應硬體與工具鏈。儲存庫也包含[運算測試](https://github.com/deepseek-ai/DeepGEMM-Ascend/tree/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests)。BIG CHANGE 檢視了文件與程式碼，但沒有執行建置或核心。

## 基準測試涵蓋到什麼程度

DeepSeek 表示，測量使用搭載 CANN 9.20 的 Ascend 950DT，並採用 `bench_msprof` 與冷 L2 快取。針對一種密集 BF16 矩陣乘法形狀（M=4096、N=7168、K=16384），其[效能表](https://github.com/deepseek-ai/DeepGEMM-Ascend#performance)列出 2,229.9 微秒、431 TFLOPS，以及該表所載硬體上限的 99.8%。在相同形狀下，FP8×FP8 的結果為 1,117.6 微秒和 861 TFLOPS。這些是在指定資料型別與形狀下測得的核心數據，並非模型吞吐量測量。表格也列出各自設定下的分組 GEMM、MQA、MegaMoE 與 prenorm 結果；MegaMoE 數值是以八個 rank、八路 expert parallelism、top-k 路由值六及一個共享 expert 計算的平均值。

該[測試程式碼](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py)會將 GEMM 輸出與產生的參考值比對，並在支援的密集案例中使用 ACLNN 交叉檢查。對部分形狀與配方，程式會明確略過這項額外 ACLNN 比較。公開程式碼與測試讓相關主張可供檢視，但 BIG CHANGE 尚未獨立重現 README 的數據。此次發布沒有提供與其他加速器堆疊的同條件基準比較、成本比較或端到端服務結果。

## 主要變化

DeepSeek 已為 Ascend 950 系列發布 DeepGEMM Ascend 核心程式碼。

開發者可檢視並建置該硬體適用的熟悉 GEMM 與相關模型運算。發布文件列出 CANN 9.20，以及 Ascend 專用的縮放因子布局。

這讓 Ascend 950 團隊取得核心程式碼，可依自己的模型形狀進行評估。DeepSeek 在一套 Ascend 950DT 測試環境中公布接近硬體上限的結果；BIG CHANGE 並未執行這些核心。

完整應用程式效能、對其他 Ascend 裝置的支援，以及營運成本仍有待確認。

## 資料來源與延伸閱讀

- [DeepGEMM Ascend 儲存庫與 README](https://github.com/deepseek-ai/DeepGEMM-Ascend)：9 月 30 日的發布說明、先決條件、介面主張及專案自行撰寫的基準測試表。README 是專案維護者提供的一手資料，並非獨立驗證。
- [套件匯出項目](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py)與[建置設定](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/setup.py)：初始提交中的版本、公開 Python 函式、相依項目聲明及原始碼建置連結方式。
- [GEMM 測試框架](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py)：儲存庫如何檢查輸出並呼叫分析器，以及哪些情況會略過 ACLNN 比較。這些檔案並未獨立重現已公布的數據。

## Sources

- [DeepSeek AI，DeepGEMM Ascend 儲存庫與 README](https://github.com/deepseek-ai/DeepGEMM-Ascend) — 介面、先決條件、安裝方式與專案自製基準測試的主要來源；已公布數據並非獨立測得的結果。
- [初次公開提交](https://github.com/deepseek-ai/DeepGEMM-Ascend/commit/8491bbb4b8c02a094a2318965f50c70438a3e73c) — 初次公開提交日期為 01:07 UTC，用來確認來源修訂版本與發布時間。
- [DeepGEMM Ascend Python 套件匯出項目](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py) — 版本 0.1.0，以及公開的 GEMM、MQA、MegaMoE、縮放布局與 JIT 控制項；匯出項目本身不能證明其可在我們的系統上執行。
- [建置設定與 GEMM 測試框架](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py) — 測試邏輯、正確性參考值與有條件執行的 ACLNN 檢查；檢視程式碼不等於重現基準測試。
