世界は立ち止まらない。RSS
BIG CHANGE.

Markdown版

AI-translated from English; not yet reviewed by a fluent editor.

# DeepSeek、Huawei Ascend 950向けのDeepGEMMカーネルを公開

> DeepSeekの新しいAscend 950用カーネルライブラリは、使い慣れたDeepGEMMのインターフェースとソースコードを備えています。前提条件と同社が公表したベンチマークが、開発者による評価の範囲を定めています。

By BIG CHANGE Editorial

Published: 2026-09-30T17:47:47.035Z
Updated: 2026-09-30T17:47:47.035Z
Canonical: https://bigchange.ai/blog/deepseek-deepgemm-ascend-950-kernels

![Conceptual charcoal illustration of a generic rackmount computer chassis in an open test rack, seen from behind with two cables routed down the frame.](https://bigchange.ai/api/media/file/deepgemm-ascend-evaluation-rack-hero-v2.png)
AI-generated by OpenAI; BIG CHANGE conceptual editorial illustration.

DeepSeekは、Huaweiの950シリーズNPUを使う開発者向けに、[DeepGEMMカーネルライブラリのAscend版](https://github.com/deepseek-ai/DeepGEMM-Ascend)を公開しました。リポジトリのREADMEによると、初回リリース日は2026年9月30日で、Pythonパッケージのバージョンは0.1.0です。このライブラリは、同ハードウェアで行列乗算や関連するモデル演算を行うためのオープンソースの出発点をチームに提供します。現時点での性能データはDeepSeek自身のテストによるものです。

この公開は、Ascendのソフトウェアスタックを評価するエンジニアにとって重要です。カーネルのソースコード、使い慣れたDeepGEMMのエントリーポイント、拡張機能のビルド手順が文書化されているためです。モデル全体の性能と運用コストは、対象システムで実際のワークロードを試して確認する必要があります。

## リリースに含まれるもの

DeepGEMMは、AIモデルで繰り返し使われる行列演算のライブラリです。[Ascend README](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/main/README.md)には、BF16、FP8、FP4のGEMMカーネル、混合エキスパートモデル向けのグループ演算、MQA logits、融合型MegaMoE演算、mHC prenormカーネルが列挙されています。 [Pythonパッケージのエクスポート](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py)には、denseおよびgrouped GEMM関数、MQA関数、スケーリング係数の配置を扱うヘルパー、JITコンパイルとAI coreの使用制御が含まれます。リポジトリのライセンスはMITです。

DeepSeekによると、Ascend移植版はAPIレベルで[上流版DeepGEMM](https://github.com/deepseek-ai/DeepGEMM#interfaces)と完全に互換性があります。同じ`deep_gemm`パッケージ名と公開インターフェースの多くはコード移行を容易にする可能性がありますが、READMEは重要なデータ配置の違いを示しています。Ascendでは、K方向に並ぶUE8M0スケーリング係数の各ペアを16ビット値にまとめ、`int16`に格納し、パックした値をMN-major順で保存します。パッケージはスケーリング係数を必要な配置に変換する関数を公開しています。量子化入力を使うアプリケーションは、適切なデータを用意し、自ら結果を検証する必要があります。互換性は保守担当者の主張であり、BIG CHANGEによる移行テストの結果ではありません。

## 開発者が試すために必要なもの

文書に記載された[要件](https://github.com/deepseek-ai/DeepGEMM-Ascend#requirements)は、Ascend NPU、CANN 9.20と`bisheng`および`ld.lld`の各ツール、`torch_npu`、Python 3.10以降、C++20に対応するコンパイラーと標準ライブラリ`<format>`です。保守担当者によると、開発と検証はAscend 950シリーズで行われました。`tilelang`はHC prenormカーネルのパッケージ依存関係として宣言されています。`tree-sitter`と`tree-sitter-cpp`は、ソースからビルドする際に型スタブを生成するために必要です。READMEは`torch_npu`のバージョンを固定しておらず、ほかのAscendデバイスでの検証も示していません。

READMEは、サブモジュールを含めてリポジトリをクローンし、`develop.sh`でC++拡張をビルドするよう案内しています。または、チェックアウトしたソースから`pip install . --no-build-isolation`でインストールできます。その[ビルド設定](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/setup.py)は`torch`と`torch_npu`をインポートし、`ASCEND_HOME_PATH`または`ASCEND_TOOLKIT_HOME`を使ってAscendツールキットを探し、AscendとTorch NPUのライブラリにリンクします。したがって、カーネルの評価には適切なハードウェアとツールチェーンが必要です。リポジトリには[演算テスト](https://github.com/deepseek-ai/DeepGEMM-Ascend/tree/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests)も含まれます。BIG CHANGEは文書とコードを確認しましたが、ビルドやカーネルの実行は行っていません。

## ベンチマークで分かる範囲

DeepSeekは、CANN 9.20を搭載したAscend 950DTで、`bench_msprof`を使い、L2キャッシュが冷えた状態で測定したと報告しています。密なBF16行列乗算の形状M=4096、N=7168、K=16384では、[性能表](https://github.com/deepseek-ai/DeepGEMM-Ascend#performance)に2,229.9マイクロ秒、431 TFLOPS、同表に示されたハードウェア上限の99.8%と記載されています。同じ形状のFP8×FP8では、1,117.6マイクロ秒、861 TFLOPSと報告されています。これらは指定された型と形状におけるカーネルの測定値であり、モデルのスループットではありません。表には、それぞれ異なる構成でのgrouped GEMM、MQA、MegaMoE、prenormの結果もあります。MegaMoEの数値は、8ランク、8-wayのexpert parallelism、top-kルーティング6、共有expert 1つの条件での平均です。

その[テストコード](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py)はGEMMの出力を生成した参照値と照合し、対応するdenseケースではACLNNによるクロスチェックを行います。一部の形状やレシピでは、この補足的なACLNN比較を明示的に省略します。公開コードとテストにより主張を調べることはできますが、BIG CHANGEはREADMEの数値を独自に再現していません。この公開には、別のアクセラレータスタックとの同条件ベンチマーク、コスト比較、エンドツーエンドのサービス結果はありません。

## 主な変化

DeepSeekは、Ascend 950シリーズ向けにDeepGEMM Ascendのカーネルコードを公開しました。

開発者は、このハードウェア向けの使い慣れたGEMMや関連するモデル演算を確認し、ビルドできます。公開資料にはCANN 9.20とAscend固有のスケーリング係数配置が記載されています。

これにより、Ascend 950を使うチームは、自社モデルの形状に合わせて評価できるカーネルコードを入手できます。DeepSeekは、1つのAscend 950DTテスト構成で上限に近い結果を報告していますが、BIG CHANGEはカーネルを実行していません。

アプリケーション全体の性能、ほかのAscendデバイスへの対応、運用コストは今後の確認が必要です。

## 出典と関連資料

- [DeepGEMM AscendリポジトリとREADME](https://github.com/deepseek-ai/DeepGEMM-Ascend):9月30日のリリースノート、前提条件、インターフェースに関する主張、プロジェクト作成のベンチマーク表。READMEはプロジェクト保守担当者による一次資料であり、独立検証ではありません。
- [パッケージのエクスポート](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py)と[ビルド設定](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/setup.py):初回コミット時点のバージョン、公開Python関数、依存関係の宣言、ソースビルドのリンク設定。
- [GEMMテストハーネス](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py):リポジトリが出力を検証し、プロファイラーを呼び出す方法と、ACLNN比較を省略する条件を説明しています。これらのファイルは公表値を独立して再現したものではありません。

## Sources

- [DeepSeek AI、DeepGEMM AscendリポジトリとREADME](https://github.com/deepseek-ai/DeepGEMM-Ascend) — インターフェース、前提条件、インストール方法、プロジェクト作成のベンチマークに関する一次資料。公表値は独立した測定結果ではありません。
- [初回の公開コミット](https://github.com/deepseek-ai/DeepGEMM-Ascend/commit/8491bbb4b8c02a094a2318965f50c70438a3e73c) — 初回の公開コミットは01:07 UTC付けで、ソースのリビジョンを確定し、公開時刻を確認するために使われました。
- [DeepGEMM Ascend Pythonパッケージのエクスポート](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py) — バージョン0.1.0と、公開されているGEMM、MQA、MegaMoE関数、スケーリング配置、JIT制御を記録しています。エクスポート情報だけでは、当社のシステムで動作することは証明されません。
- [ビルド設定とGEMMテストハーネス](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py) — テストロジック、正確性の参照値、条件付きのACLNNチェックを説明しています。コードの確認はベンチマークの再現とは異なります。
BIG CHANGEニュースレター

大局を、あなたのペースで。

AI とロボティクスの最新記事、注目すべき変化、活用できる実用的なアイデア。日刊ブリーフィング、週刊ダイジェスト、月刊展望から選べます。