DeepSeek telah menerbitkan versi Ascend dari pustaka kernel DeepGEMM untuk pengembang yang bekerja dengan NPU seri 950 Huawei. README repositori mencatat tanggal rilis awal 30 September 2026; paket Python mencantumkan versi 0.1.0. Pustaka ini memberi tim titik awal sumber terbuka untuk perkalian matriks dan operasi model terkait pada perangkat keras tersebut. Sejauh ini, angka kinerja berasal dari pengujian DeepSeek sendiri.

Rilis ini relevan bagi teknisi yang menilai tumpukan perangkat lunak Ascend karena menyediakan kode sumber kernel dan titik masuk DeepGEMM yang sudah dikenal, serta langkah terdokumentasi untuk membangun ekstensi. Kinerja model secara keseluruhan dan biaya operasional masih perlu diuji dengan beban kerja pada sistem yang akan digunakan.

Apa yang disertakan dalam rilis

DeepGEMM adalah pustaka untuk operasi matriks yang berulang kali digunakan dalam model AI. README Ascend mencantumkan kernel GEMM BF16, FP8, dan FP4; operasi berkelompok untuk model mixture-of-experts; logits MQA; operasi MegaMoE terpadu; serta kernel mHC prenorm. Ekspor paket Python menampilkan fungsi GEMM padat dan berkelompok, fungsi MQA, alat bantu tata letak faktor skala, serta kontrol untuk kompilasi JIT dan penggunaan AI core. Repositori ini menggunakan lisensi MIT.

DeepSeek menyatakan bahwa port Ascend sepenuhnya kompatibel pada tingkat API dengan DeepGEMM upstream. Nama deep_gemm paket yang sama dan sebagian besar antarmuka publik dapat memudahkan migrasi kode, tetapi README menjelaskan perbedaan tata letak data yang penting: Ascend mengemas setiap pasangan faktor skala UE8M0 sepanjang K menjadi nilai 16-bit int16 dan menyimpan nilai yang dikemas dalam urutan MN-major. Paket ini mengekspor fungsi untuk mengubah faktor skala ke tata letak yang diwajibkan tersebut. Aplikasi yang memakai masukan terkuantisasi tetap harus menyediakan data yang sesuai dan memvalidasi hasilnya sendiri; klaim kompatibilitas berasal dari pengelola, bukan dari pengujian migrasi oleh BIG CHANGE.

Yang diperlukan pengembang untuk mencobanya

Persyaratan yang didokumentasikan adalah NPU Ascend, CANN 9.20 dengan alat bisheng dan ld.lld, torch_npu, Python 3.10 atau lebih baru, serta compiler dan pustaka standar yang mendukung C++20 <format>. Pengelola menyatakan bahwa pengembangan dan validasi dilakukan pada seri Ascend 950. tilelang dinyatakan sebagai dependensi paket untuk kernel HC prenorm; tree-sitter dan tree-sitter-cpp diperlukan untuk membuat stub tipe saat membangun dari kode sumber. README tidak menetapkan versi torch_npu atau menyatakan bahwa perangkat Ascend lain telah divalidasi.

README menginstruksikan pengembang untuk mengkloning repositori beserta submodulnya, lalu membangun ekstensi C++ melalui develop.sh, atau menginstalnya dari kode sumber yang telah diambil dengan pip install . --no-build-isolation. Konfigurasi build-nya mengimpor torch dan torch_npu, menemukan toolkit Ascend melalui ASCEND_HOME_PATH atau ASCEND_TOOLKIT_HOME, lalu menautkan pustaka Ascend dan Torch NPU. Karena itu, evaluasi kernel memerlukan perangkat keras dan toolchain yang sesuai. Repositori ini juga menyertakan pengujian operasi. BIG CHANGE memeriksa dokumentasi dan kode, tetapi tidak menjalankan proses build atau kernelnya.

Batas cakupan tolok ukur

DeepSeek melaporkan pengukuran pada Ascend 950DT dengan CANN 9.20, menggunakan bench_msprof dengan cache L2 dingin. Untuk satu bentuk perkalian matriks BF16 padat dengan M=4096, N=7168, dan K=16384, pada tabel kinerjanya tercantum 2.229,9 mikrodetik, 431 TFLOPS, dan 99,8% dari batas perangkat keras yang dinyatakan di tabel tersebut. Untuk bentuk yang sama, kinerja FP8×FP8 dilaporkan 1.117,6 mikrodetik dan 861 TFLOPS. Ini adalah pengukuran kernel pada tipe dan bentuk tertentu, bukan pengukuran throughput model. Tabel itu juga memuat hasil GEMM berkelompok, MQA, MegaMoE, dan prenorm dengan konfigurasi masing-masing; angka MegaMoE merupakan rata-rata untuk delapan rank, paralelisme expert delapan, perutean top-k enam, dan satu shared expert.

Kode pengujian membandingkan keluaran GEMM dengan referensi yang dibuat dan menggunakan pemeriksaan silang ACLNN untuk kasus padat yang didukung. Kode tersebut secara eksplisit melewati perbandingan ACLNN tambahan untuk beberapa bentuk dan resep. Kode dan pengujian yang diterbitkan membuat klaimnya dapat diperiksa, tetapi BIG CHANGE belum mereproduksi angka README secara independen. Rilis ini tidak menyertakan tolok ukur setara terhadap tumpukan akselerator lain, perbandingan biaya, atau hasil layanan dari awal hingga akhir.

Perubahan utama

DeepSeek telah merilis kode kernel DeepGEMM Ascend untuk seri Ascend 950.

Pengembang dapat memeriksa dan membangun operasi GEMM yang sudah dikenal serta operasi model terkait untuk perangkat keras tersebut. Rilis ini mendokumentasikan CANN 9.20 dan tata letak faktor skala khusus Ascend.

Tim pengguna Ascend 950 kini memiliki kode kernel untuk dievaluasi dengan bentuk model mereka sendiri. DeepSeek melaporkan hasil mendekati batas pada satu konfigurasi uji Ascend 950DT; BIG CHANGE belum menjalankan kernel tersebut.

Kinerja aplikasi secara menyeluruh, dukungan untuk perangkat Ascend lain, dan biaya operasional masih perlu dipastikan.

Sumber dan bacaan lanjutan

  • Repositori dan README DeepGEMM Ascend: catatan rilis 30 September, prasyarat, klaim antarmuka, dan tabel tolok ukur buatan proyek. README merupakan sumber primer dari pengelola proyek, bukan validasi independen.
  • Ekspor paket dan konfigurasi build: versi, fungsi Python publik, deklarasi dependensi, dan tautan build sumber pada commit awal.
  • Harness pengujian GEMM: cara repositori memeriksa keluaran dan memanggil profiler, termasuk kondisi saat perbandingan ACLNN dilewati. Berkas ini tidak mereproduksi angka yang diterbitkan secara independen.