Naglathala ang DeepSeek ng Ascend na bersyon ng DeepGEMM kernel library nito para sa mga developer na gumagamit ng mga NPU ng Huawei 950 series. Itinatala ng README ng repository ang unang release noong Setyembre 30, 2026; bersyong 0.1.0 ang nakasaad sa Python package. Nagbibigay ito sa mga team ng open-source na panimulang punto para sa matrix multiplication at kaugnay na operasyon ng modelo sa hardware na iyon. Mga sariling pagsubok ng DeepSeek ang pinagmulan ng mga inilabas na bilang ng performance sa ngayon.
Mahalaga ang release na ito sa mga engineer na sumusuri sa software stack ng Ascend dahil inilalantad nito ang source code ng mga kernel at pamilyar na DeepGEMM entry point, kasama ang dokumentadong paraan ng pagbuo ng extension. Kailangan pa ring subukan ang performance ng buong modelo at gastos sa pagpapatakbo gamit ang aktuwal na workload sa nilalayong sistema.
Ano ang laman ng release
Ang DeepGEMM ay library para sa mga operasyong matrix na paulit-ulit gamitin sa mga AI model. Nasa README ng Ascend ang mga kernel na BF16, FP8 at FP4 GEMM, mga naka-grupong operasyon para sa mixture-of-experts model, MQA logits, pinagsamang MegaMoE operation, at mHC prenorm kernel. Ipinapakita ng mga export ng Python package ang mga dense at grouped GEMM function, MQA function, helper para sa ayos ng scaling factor, at mga kontrol sa JIT compilation at paggamit ng AI core. Nasa ilalim ng MIT license ang repository.
Ayon sa DeepSeek, ganap na tugma sa API ang Ascend port sa upstream na DeepGEMM. Pareho ang deep_gemm pangalan ng package at malaking bahagi ng pampublikong interface, kaya maaaring mapadali ang paglipat ng code. Gayunman, itinatampok ng README ang mahalagang pagkakaiba sa ayos ng data: pinagsasama ng Ascend ang bawat pares ng UE8M0 scaling factor sa axis K bilang isang int16 at iniimbak ang pinagsama-samang value sa MN-major na pagkakasunod-sunod. May mga function na inilalantad ang package para ilipat ang mga scaling factor sa kinakailangang ayos. Kailangan pa ring magbigay ng angkop na data at beripikahin ang sariling resulta ng application na gumagamit ng quantized input; pahayag ito ng mga maintainer tungkol sa compatibility, hindi pagsubok sa paglipat na isinagawa ng BIG CHANGE.
Ano ang kailangan ng developer para masubukan ito
Ang mga dokumentadong kinakailangan ay isang Ascend NPU, CANN 9.20 na may bisheng at ld.lld tool, torch_npu, Python 3.10 o mas bago, at compiler at standard library na sumusuporta sa C++20 <format>. Ayon sa mga maintainer, sa Ascend 950 series isinagawa ang development at validation. tilelang ang nakasaad na dependency ng package para sa HC prenorm kernel; tree-sitter at tree-sitter-cpp ang kailangan para gumawa ng type stub kapag nagbu-build mula sa source. Hindi nagtatakda ang README ng torch_npu bersyon o nagpapatunay na na-validate ito sa ibang Ascend device.
Inaatasan ng README ang mga developer na i-clone ang repository kasama ang mga submodule nito, buuin ang C++ extension gamit ang develop.sh, o mag-install mula sa na-checkout na source gamit ang pip install . --no-build-isolation. Ini-import ng configuration ng build ang torch at torch_npu, hinahanap ang Ascend toolkit sa pamamagitan ng ASCEND_HOME_PATH o ASCEND_TOOLKIT_HOME, at iniuugnay ang Ascend at Torch NPU library. Kaya kailangan ang angkop na hardware at toolchain para masuri ang mga kernel. Kasama sa repository ang mga pagsubok sa operasyon. Sinuri ng BIG CHANGE ang dokumentasyon at code; hindi nito pinatakbo ang build o mga kernel.
Hanggang saan umaabot ang benchmark
Iniuulat ng DeepSeek ang mga sukat sa Ascend 950DT na may CANN 9.20, gamit ang bench_msprof habang malamig ang L2 cache. Para sa isang dense BF16 matrix multiplication na may M=4096, N=7168 at K=16384, inililista ng talahanayan ng performance ang 2,229.9 microsecond, 431 TFLOPS at 99.8% ng limitasyon ng hardware na nakasaad dito. Sa parehong sukat, iniulat nito ang 1,117.6 microsecond at 861 TFLOPS para sa FP8×FP8. Mga sukat ito ng kernel sa tinukoy na data type at sukat, hindi ng throughput ng modelo. Naglalaman din ang talahanayan ng mga resulta para sa grouped GEMM, MQA, MegaMoE at prenorm sa magkakahiwalay na configuration; average ng walong rank ang mga halaga ng MegaMoE, na may expert parallelism na walo, top-k routing na anim at isang shared expert.
Sinusuri ng test code ang mga output ng GEMM laban sa mga ginawang reference at gumagamit ng ACLNN cross-check para sa mga sinusuportahang dense case. Tahasan nitong nilalaktawan ang karagdagang paghahambing sa ACLNN para sa ilang sukat at recipe. Nasusuri ang mga pahayag sa inilabas na code at mga test, ngunit hindi pa independiyenteng naiuulit ng BIG CHANGE ang mga bilang sa README. Walang benchmark na maihahambing nang patas sa ibang accelerator stack, paghahambing ng gastos, o resulta ng end-to-end service sa release.
Ang malaking pagbabago
Inilabas ng DeepSeek ang DeepGEMM Ascend kernel code para sa Ascend 950 series.
Maaaring suriin at buuin ng mga developer ang pamilyar na GEMM at kaugnay na operasyon ng modelo para sa hardware na iyon. Inilalarawan ng release ang CANN 9.20 at isang ayos ng scaling factor na partikular sa Ascend.
May kernel code na ngayon ang mga team na gumagamit ng Ascend 950 upang subukan sa sarili nilang mga sukat ng modelo. Iniulat ng DeepSeek ang mga resultang malapit sa limitasyon sa isang Ascend 950DT test setup; hindi pinatakbo ng BIG CHANGE ang mga kernel.
Kailangan pang matukoy ang performance ng buong application, suporta sa iba pang Ascend device at gastos sa pagpapatakbo.
Mga source at karagdagang babasahin
- Repository at README ng DeepGEMM Ascend: tala ng release noong Setyembre 30, mga kinakailangan, pahayag tungkol sa interface at mga benchmark na ginawa ng proyekto. Pangunahing source ang README mula sa mga maintainer ng proyekto, hindi independiyenteng validation.
- Mga export ng package at configuration ng build: bersyon, pampublikong Python function, deklarasyon ng dependency at pag-uugnay sa source build sa unang commit.
- GEMM test harness: kung paano sinusuri ng repository ang mga output at tinatawag ang profiler nito, pati ang mga kundisyong nilalaktawan ang paghahambing sa ACLNN. Hindi nito independiyenteng inuulit ang mga inilabas na bilang.



