AI-translated from English; not yet reviewed by a fluent editor.

# DeepSeek, naglabas ng DeepGEMM kernels para sa Huawei Ascend 950

> Nag-aalok ang bagong Ascend 950 kernel library ng DeepSeek ng pamilyar na DeepGEMM interface at source code. Itinatakda ng mga kinakailangan at sariling benchmark nito ang mga hangganan para sa mga developer na nagsusuri rito.

By BIG CHANGE Editorial

Published: 2026-09-30T17:47:47.035Z
Updated: 2026-09-30T17:47:47.035Z
Canonical: https://bigchange.ai/blog/deepseek-deepgemm-ascend-950-kernels

![Conceptual charcoal illustration of a generic rackmount computer chassis in an open test rack, seen from behind with two cables routed down the frame.](https://bigchange.ai/api/media/file/deepgemm-ascend-evaluation-rack-hero-v2.png)
AI-generated by OpenAI; BIG CHANGE conceptual editorial illustration.

Naglathala ang DeepSeek ng [Ascend na bersyon ng DeepGEMM kernel library nito](https://github.com/deepseek-ai/DeepGEMM-Ascend) para sa mga developer na gumagamit ng mga NPU ng Huawei 950 series. Itinatala ng README ng repository ang unang release noong Setyembre 30, 2026; bersyong 0.1.0 ang nakasaad sa Python package. Nagbibigay ito sa mga team ng open-source na panimulang punto para sa matrix multiplication at kaugnay na operasyon ng modelo sa hardware na iyon. Mga sariling pagsubok ng DeepSeek ang pinagmulan ng mga inilabas na bilang ng performance sa ngayon.

Mahalaga ang release na ito sa mga engineer na sumusuri sa software stack ng Ascend dahil inilalantad nito ang source code ng mga kernel at pamilyar na DeepGEMM entry point, kasama ang dokumentadong paraan ng pagbuo ng extension. Kailangan pa ring subukan ang performance ng buong modelo at gastos sa pagpapatakbo gamit ang aktuwal na workload sa nilalayong sistema.

## Ano ang laman ng release

Ang DeepGEMM ay library para sa mga operasyong matrix na paulit-ulit gamitin sa mga AI model. Nasa [README ng Ascend ](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/main/README.md)ang mga kernel na BF16, FP8 at FP4 GEMM, mga naka-grupong operasyon para sa mixture-of-experts model, MQA logits, pinagsamang MegaMoE operation, at mHC prenorm kernel. Ipinapakita ng mga [export ng Python package ](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py)ang mga dense at grouped GEMM function, MQA function, helper para sa ayos ng scaling factor, at mga kontrol sa JIT compilation at paggamit ng AI core. Nasa ilalim ng MIT license ang repository.

Ayon sa DeepSeek, ganap na tugma sa API ang Ascend port sa [upstream na DeepGEMM](https://github.com/deepseek-ai/DeepGEMM#interfaces). Pareho ang `deep_gemm` pangalan ng package at malaking bahagi ng pampublikong interface, kaya maaaring mapadali ang paglipat ng code. Gayunman, itinatampok ng README ang mahalagang pagkakaiba sa ayos ng data: pinagsasama ng Ascend ang bawat pares ng UE8M0 scaling factor sa axis K bilang isang `int16` at iniimbak ang pinagsama-samang value sa MN-major na pagkakasunod-sunod. May mga function na inilalantad ang package para ilipat ang mga scaling factor sa kinakailangang ayos. Kailangan pa ring magbigay ng angkop na data at beripikahin ang sariling resulta ng application na gumagamit ng quantized input; pahayag ito ng mga maintainer tungkol sa compatibility, hindi pagsubok sa paglipat na isinagawa ng BIG CHANGE.

## Ano ang kailangan ng developer para masubukan ito

Ang mga [dokumentadong kinakailangan](https://github.com/deepseek-ai/DeepGEMM-Ascend#requirements) ay isang Ascend NPU, CANN 9.20 na may `bisheng` at `ld.lld` tool, `torch_npu`, Python 3.10 o mas bago, at compiler at standard library na sumusuporta sa C++20 `<format>`. Ayon sa mga maintainer, sa Ascend 950 series isinagawa ang development at validation. `tilelang` ang nakasaad na dependency ng package para sa HC prenorm kernel; `tree-sitter` at `tree-sitter-cpp` ang kailangan para gumawa ng type stub kapag nagbu-build mula sa source. Hindi nagtatakda ang README ng `torch_npu` bersyon o nagpapatunay na na-validate ito sa ibang Ascend device.

Inaatasan ng README ang mga developer na i-clone ang repository kasama ang mga submodule nito, buuin ang C++ extension gamit ang `develop.sh`, o mag-install mula sa na-checkout na source gamit ang `pip install . --no-build-isolation`. Ini-import ng [configuration ng build](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/setup.py) ang `torch` at `torch_npu`, hinahanap ang Ascend toolkit sa pamamagitan ng `ASCEND_HOME_PATH` o `ASCEND_TOOLKIT_HOME`, at iniuugnay ang Ascend at Torch NPU library. Kaya kailangan ang angkop na hardware at toolchain para masuri ang mga kernel. Kasama sa repository ang mga [pagsubok sa operasyon](https://github.com/deepseek-ai/DeepGEMM-Ascend/tree/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests). Sinuri ng BIG CHANGE ang dokumentasyon at code; hindi nito pinatakbo ang build o mga kernel.

## Hanggang saan umaabot ang benchmark

Iniuulat ng DeepSeek ang mga sukat sa Ascend 950DT na may CANN 9.20, gamit ang `bench_msprof` habang malamig ang L2 cache. Para sa isang dense BF16 matrix multiplication na may M=4096, N=7168 at K=16384, inililista ng [talahanayan ng performance](https://github.com/deepseek-ai/DeepGEMM-Ascend#performance) ang 2,229.9 microsecond, 431 TFLOPS at 99.8% ng limitasyon ng hardware na nakasaad dito. Sa parehong sukat, iniulat nito ang 1,117.6 microsecond at 861 TFLOPS para sa FP8×FP8. Mga sukat ito ng kernel sa tinukoy na data type at sukat, hindi ng throughput ng modelo. Naglalaman din ang talahanayan ng mga resulta para sa grouped GEMM, MQA, MegaMoE at prenorm sa magkakahiwalay na configuration; average ng walong rank ang mga halaga ng MegaMoE, na may expert parallelism na walo, top-k routing na anim at isang shared expert.

Sinusuri ng [test code](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py) ang mga output ng GEMM laban sa mga ginawang reference at gumagamit ng ACLNN cross-check para sa mga sinusuportahang dense case. Tahasan nitong nilalaktawan ang karagdagang paghahambing sa ACLNN para sa ilang sukat at recipe. Nasusuri ang mga pahayag sa inilabas na code at mga test, ngunit hindi pa independiyenteng naiuulit ng BIG CHANGE ang mga bilang sa README. Walang benchmark na maihahambing nang patas sa ibang accelerator stack, paghahambing ng gastos, o resulta ng end-to-end service sa release.

## Ang malaking pagbabago

Inilabas ng DeepSeek ang DeepGEMM Ascend kernel code para sa Ascend 950 series.

Maaaring suriin at buuin ng mga developer ang pamilyar na GEMM at kaugnay na operasyon ng modelo para sa hardware na iyon. Inilalarawan ng release ang CANN 9.20 at isang ayos ng scaling factor na partikular sa Ascend.

May kernel code na ngayon ang mga team na gumagamit ng Ascend 950 upang subukan sa sarili nilang mga sukat ng modelo. Iniulat ng DeepSeek ang mga resultang malapit sa limitasyon sa isang Ascend 950DT test setup; hindi pinatakbo ng BIG CHANGE ang mga kernel.

Kailangan pang matukoy ang performance ng buong application, suporta sa iba pang Ascend device at gastos sa pagpapatakbo.

## Mga source at karagdagang babasahin

- [Repository at README ng DeepGEMM Ascend](https://github.com/deepseek-ai/DeepGEMM-Ascend): tala ng release noong Setyembre 30, mga kinakailangan, pahayag tungkol sa interface at mga benchmark na ginawa ng proyekto. Pangunahing source ang README mula sa mga maintainer ng proyekto, hindi independiyenteng validation.
- [Mga export ng package](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py) at [configuration ng build](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/setup.py): bersyon, pampublikong Python function, deklarasyon ng dependency at pag-uugnay sa source build sa unang commit.
- [GEMM test harness](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py): kung paano sinusuri ng repository ang mga output at tinatawag ang profiler nito, pati ang mga kundisyong nilalaktawan ang paghahambing sa ACLNN. Hindi nito independiyenteng inuulit ang mga inilabas na bilang.

## Sources

- [DeepSeek AI, repository at README ng DeepGEMM Ascend](https://github.com/deepseek-ai/DeepGEMM-Ascend) — Pangunahing tala para sa mga interface, kinakailangan, pag-install at mga benchmark na ginawa ng proyekto; hindi independiyenteng resulta ang mga inilabas na bilang.
- [Unang pampublikong commit](https://github.com/deepseek-ai/DeepGEMM-Ascend/commit/8491bbb4b8c02a094a2318965f50c70438a3e73c) — May petsang 01:07 UTC ang unang pampublikong commit; ginamit ito upang itakda ang source revision at beripikahin ang oras ng release.
- [Mga export ng Python package ng DeepGEMM Ascend](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py) — Bersyong 0.1.0 at mga inilalantad na GEMM, MQA, MegaMoE, scaling-layout at JIT control; hindi pinatutunayan ng mga export na gumagana ang mga ito sa aming mga sistema.
- [Configuration ng build at GEMM test harness](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py) — Loohika ng test, mga reference para sa correctness at mga conditional ACLNN check; hindi katumbas ng naulit na benchmark ang pagsusuri sa code.
