AI-translated from English; not yet reviewed by a fluent editor.

# DeepSeek veröffentlicht DeepGEMM-Kernels für Huawei Ascend 950

> DeepSeeks neue Kernel-Bibliothek für Ascend 950 bietet vertraute DeepGEMM-Schnittstellen und Quellcode. Voraussetzungen und selbst berichtete Benchmarks stecken den Rahmen für Entwickler ab, die sie bewerten.

By BIG CHANGE Editorial

Published: 2026-09-30T17:47:47.035Z
Updated: 2026-09-30T17:47:47.035Z
Canonical: https://bigchange.ai/blog/deepseek-deepgemm-ascend-950-kernels

![Conceptual charcoal illustration of a generic rackmount computer chassis in an open test rack, seen from behind with two cables routed down the frame.](https://bigchange.ai/api/media/file/deepgemm-ascend-evaluation-rack-hero-v2.png)
AI-generated by OpenAI; BIG CHANGE conceptual editorial illustration.

DeepSeek hat eine [Ascend-Version seiner DeepGEMM-Kernel-Bibliothek](https://github.com/deepseek-ai/DeepGEMM-Ascend) für Entwickler veröffentlicht, die Huawei-NPUs der 950-Serie einsetzen. Das README des Repositorys datiert die Erstveröffentlichung auf den 30. September 2026; das Python-Paket ist mit Version 0.1.0 gekennzeichnet. Es bietet Teams einen quelloffenen Ausgangspunkt für Matrixmultiplikation und verwandte Modelloperationen auf dieser Hardware. Die bislang veröffentlichten Leistungswerte stammen aus eigenen Tests von DeepSeek.

Die Veröffentlichung ist für Ingenieure relevant, die einen Ascend-Software-Stack bewerten: Sie stellt Kernel-Quellcode und vertraute DeepGEMM-Einstiegspunkte bereit und dokumentiert, wie sich die Erweiterung erstellen lässt. Leistung und Betriebskosten vollständiger Modelle müssen weiterhin mit den vorgesehenen Workloads auf dem Zielsystem getestet werden.

## Was die Veröffentlichung enthält

DeepGEMM ist eine Bibliothek für Matrixoperationen, die in KI-Modellen häufig eingesetzt werden. Das [Ascend-README ](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/main/README.md)führt BF16-, FP8- und FP4-GEMM-Kernels, gruppierte Operationen für Mixture-of-Experts-Modelle, MQA-Logits, eine fusionierte MegaMoE-Operation und einen mHC-Prenorm-Kernel auf. Die [Exporte des Python-Pakets ](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py)zeigen Funktionen für dichtes und gruppiertes GEMM, MQA-Funktionen, Hilfsfunktionen für die Anordnung von Skalierungsfaktoren sowie Steuerelemente für JIT-Kompilierung und AI-Core-Nutzung. Das Repository steht unter der MIT-Lizenz.

Laut DeepSeek ist der Ascend-Port vollständig API-kompatibel mit dem [upstream DeepGEMM](https://github.com/deepseek-ai/DeepGEMM#interfaces). Derselbe `deep_gemm` Paketname und große Teile der öffentlichen Schnittstelle können eine Code-Migration erleichtern. Das README weist jedoch auf einen wichtigen Unterschied bei der Datenanordnung hin: Ascend packt jedes Paar von UE8M0-Skalierungsfaktoren entlang K in einen `int16` und speichert die gepackten Werte in MN-major-Reihenfolge. Das Paket stellt Funktionen bereit, um Skalierungsfaktoren in die erforderliche Anordnung umzuwandeln. Anwendungen mit quantisierten Eingaben müssen weiterhin geeignete Daten bereitstellen und ihre Ergebnisse selbst validieren. Die Kompatibilitätsaussage stammt von den Maintainerinnen und Maintainer, sie ist kein Migrationstest von BIG CHANGE.

## Was Entwickler zum Ausprobieren benötigen

Die [dokumentierten Voraussetzungen](https://github.com/deepseek-ai/DeepGEMM-Ascend#requirements) sind eine Ascend-NPU, CANN 9.20 mit `bisheng` und `ld.lld` als Tools, `torch_npu`, Python 3.10 oder neuer sowie ein Compiler und eine Standardbibliothek mit C++20-Unterstützung für `<format>`. Laut den Maintainerinnen und Maintainer fanden Entwicklung und Validierung auf der Ascend-950-Serie statt. `tilelang` ist als Paketabhängigkeit für den HC-Prenorm-Kernel aufgeführt; `tree-sitter` und `tree-sitter-cpp` und werden benötigt, um beim Erstellen aus dem Quellcode Typ-Stubs zu erzeugen. Das README legt keine `torch_npu` Version fest und belegt keine Validierung auf anderen Ascend-Geräten.

Das README weist Entwickler an, das Repository samt Submodulen zu klonen und die C++-Erweiterung mit `develop.sh` zu erstellen oder sie aus dem ausgecheckten Quellcode mit `pip install . --no-build-isolation` zu installieren. Die [Build-Konfiguration](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/setup.py) importiert `torch` und `torch_npu`, findet das Ascend-Toolkit über `ASCEND_HOME_PATH` oder `ASCEND_TOOLKIT_HOME` und bindet die Ascend- und Torch-NPU-Bibliotheken ein. Für die Bewertung der Kernels sind daher die passende Hardware und Toolchain erforderlich. Das Repository enthält [Operationstests](https://github.com/deepseek-ai/DeepGEMM-Ascend/tree/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests). BIG CHANGE hat die Dokumentation und den Code geprüft, aber weder den Build noch die Kernels ausgeführt.

## Wie weit der Benchmark reicht

DeepSeek berichtet Messungen auf einem Ascend 950DT mit CANN 9.20 unter Verwendung von `bench_msprof` bei kaltem L2-Cache. Für eine dichte BF16-Matrixmultiplikation mit M=4096, N=7168 und K=16384 nennt die [Leistungstabelle](https://github.com/deepseek-ai/DeepGEMM-Ascend#performance) 2.229,9 Mikrosekunden, 431 TFLOPS und 99,8 % des dort angegebenen Hardwarelimits. Für dieselbe Form werden bei FP8×FP8 1.117,6 Mikrosekunden und 861 TFLOPS angegeben. Das sind Kernelmessungen für bestimmte Datentypen und Formen, keine Messungen des Modelldurchsatzes. Die Tabelle enthält außerdem Ergebnisse für gruppiertes GEMM, MQA, MegaMoE und Prenorm mit jeweils eigenen Konfigurationen. Die MegaMoE-Werte sind Mittelwerte über acht Ranks mit achtfachem Expert Parallelism, Top-k-Routing von sechs und einem gemeinsamen Experten.

Der [Testcode ](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py)vergleicht GEMM-Ausgaben mit generierten Referenzwerten und nutzt bei unterstützten dichten Fällen einen ACLNN-Gegencheck. Für einige Formen und Rezepte wird dieser zusätzliche ACLNN-Vergleich ausdrücklich übersprungen. Der veröffentlichte Code und die Tests machen die Aussagen überprüfbar, doch BIG CHANGE hat die README-Zahlen nicht unabhängig reproduziert. Die Veröffentlichung enthält weder einen direkten Benchmarkvergleich mit einem anderen Beschleuniger-Stack noch einen Kostenvergleich oder ein End-to-End-Service-Ergebnis.

## Die große Veränderung

DeepSeek hat den DeepGEMM-Ascend-Kernelcode für die Ascend-950-Serie veröffentlicht.

Entwickler können vertraute GEMM- und verwandte Modelloperationen für diese Hardware prüfen und erstellen. Die Veröffentlichung dokumentiert CANN 9.20 und eine Ascend-spezifische Anordnung der Skalierungsfaktoren.

Teams mit Ascend 950 erhalten Kernelcode, den sie mit ihren eigenen Modellformen bewerten können. DeepSeek berichtet für einen Ascend-950DT-Testaufbau Ergebnisse nahe am Limit; BIG CHANGE hat die Kernels nicht ausgeführt.

Leistung vollständiger Anwendungen, Unterstützung weiterer Ascend-Geräte und Betriebskosten müssen noch ermittelt werden.

## Quellen und weiterführende Informationen

- [DeepGEMM-Ascend-Repository und README](https://github.com/deepseek-ai/DeepGEMM-Ascend): Versionshinweis vom 30. September, Voraussetzungen, Schnittstellenangaben und vom Projekt erstellte Benchmarktabellen. Das README ist eine Primärquelle der Projekt-Maintainer, keine unabhängige Validierung.
- [Paketexporte](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py) und [Build-Konfiguration](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/setup.py): Version, öffentliche Python-Funktionen, Abhängigkeitsangaben und Verknüpfung beim Build aus dem Quellcode im ersten Commit.
- [GEMM-Test-Harness](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py): Wie das Repository Ausgaben prüft und seinen Profiler aufruft, einschließlich der Bedingungen, unter denen ein ACLNN-Vergleich ausgelassen wird. Diese Dateien reproduzieren die veröffentlichten Zahlen nicht unabhängig.

## Sources

- [DeepSeek AI, DeepGEMM-Ascend-Repository und README](https://github.com/deepseek-ai/DeepGEMM-Ascend) — Primärquelle für Schnittstellen, Voraussetzungen, Installation und projektinterne Benchmarks; die veröffentlichten Werte sind keine unabhängigen Ergebnisse.
- [Erster öffentlicher Commit](https://github.com/deepseek-ai/DeepGEMM-Ascend/commit/8491bbb4b8c02a094a2318965f50c70438a3e73c) — Der erste öffentliche Commit trägt den Zeitstempel 01:07 UTC. Er wurde verwendet, um den Quellstand festzulegen und den Veröffentlichungszeitpunkt zu prüfen.
- [Exporte des DeepGEMM-Ascend-Python-Pakets](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py) — Version 0.1.0 und exportierte GEMM-, MQA- und MegaMoE-Funktionen sowie Steuerelemente für Skalierungsanordnung und JIT; die Exporte belegen keinen Betrieb auf unseren Systemen.
- [Build-Konfiguration und GEMM-Test-Harness](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py) — Testlogik, Korrektheitsreferenzen und bedingte ACLNN-Prüfungen; eine Codeprüfung ist keine reproduzierte Benchmarkmessung.
