O MUNDO NÃO ESTÁ PARADO.RSS
BIG CHANGE.

Edição Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# DeepSeek lança kernels DeepGEMM para o Huawei Ascend 950

> A nova biblioteca de kernels da DeepSeek para o Ascend 950 oferece interfaces DeepGEMM conhecidas e código-fonte. Os requisitos e os benchmarks publicados pela própria empresa definem os limites para os programadores que a avaliam.

By BIG CHANGE Editorial

Published: 2026-09-30T17:47:47.035Z
Updated: 2026-09-30T17:47:47.035Z
Canonical: https://bigchange.ai/blog/deepseek-deepgemm-ascend-950-kernels

![Conceptual charcoal illustration of a generic rackmount computer chassis in an open test rack, seen from behind with two cables routed down the frame.](https://bigchange.ai/api/media/file/deepgemm-ascend-evaluation-rack-hero-v2.png)
AI-generated by OpenAI; BIG CHANGE conceptual editorial illustration.

A DeepSeek publicou uma [versão Ascend da sua biblioteca de kernels DeepGEMM](https://github.com/deepseek-ai/DeepGEMM-Ascend) para programadores que trabalham com NPU da série 950 da Huawei. O README do repositório indica 30 de setembro de 2026 como data da versão inicial; o pacote Python identifica-se como versão 0.1.0. Oferece às equipas um ponto de partida de código aberto para multiplicação de matrizes e operações relacionadas com modelos nesse hardware. Os valores de desempenho publicados até agora resultam de testes da própria DeepSeek.

Este lançamento interessa aos engenheiros que avaliam uma stack de software Ascend porque disponibiliza o código-fonte dos kernels e pontos de entrada DeepGEMM conhecidos, além de documentar como compilar a extensão. O desempenho de modelos completos e os custos de operação continuam a exigir testes com as cargas de trabalho previstas no sistema de destino.

## O que inclui o lançamento

O DeepGEMM é uma biblioteca para operações matriciais usadas repetidamente em modelos de IA. O [README do Ascend ](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/main/README.md)enumera kernels GEMM BF16, FP8 e FP4, operações agrupadas para modelos de mistura de especialistas, logits MQA, uma operação MegaMoE fundida e um kernel mHC prenorm. As [exportações do pacote Python ](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py)mostram funções GEMM densas e agrupadas, funções MQA, auxiliares de disposição dos fatores de escala e controlos de compilação JIT e utilização de AI core. O repositório está sob a licença MIT.

A DeepSeek afirma que a portabilidade para Ascend é totalmente compatível com a API do [DeepGEMM original](https://github.com/deepseek-ai/DeepGEMM#interfaces). O mesmo `deep_gemm` nome do pacote e grande parte da interface pública podem facilitar uma migração de código. Ainda assim, o README identifica uma diferença importante na disposição dos dados: o Ascend agrupa cada par de fatores de escala UE8M0 ao longo de K num `int16` e armazena os valores agrupados por ordem MN-major. O pacote exporta funções para converter os fatores de escala para a disposição necessária. Uma aplicação que use entradas quantizadas continua a ter de fornecer dados adequados e validar os seus resultados; a compatibilidade é uma afirmação dos responsáveis pela manutenção, não um teste de migração da BIG CHANGE.

## O que é necessário para experimentar

Os[ requisitos documentados ](https://github.com/deepseek-ai/DeepGEMM-Ascend#requirements)são um NPU Ascend, CANN 9.20 com as ferramentas `bisheng` e `ld.lld`, `torch_npu`, Python 3.10 ou posterior e um compilador e biblioteca padrão compatíveis com C++20 `<format>`. Os responsáveis pela manutenção afirmam que o desenvolvimento e a validação decorreram na série Ascend 950. `tilelang` está declarado como dependência do pacote para o kernel HC prenorm; `tree-sitter` e `tree-sitter-cpp` e são necessários para gerar declarações de tipos ao compilar a partir do código-fonte. O README não especifica `torch_npu` uma versão nem comprova a validação noutros dispositivos Ascend.

O README instrui os programadores a clonar o repositório com os respetivos submódulos e a compilar a extensão C++ através de `develop.sh`, ou a instalá-la a partir do código-fonte obtido com `pip install . --no-build-isolation`. A sua [configuração de compilação ](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/setup.py)importa `torch` e `torch_npu`, localiza o kit de ferramentas Ascend através de `ASCEND_HOME_PATH` ou `ASCEND_TOOLKIT_HOME` e liga as bibliotecas Ascend e Torch NPU. A avaliação dos kernels exige, por isso, o hardware e a cadeia de ferramentas adequados. O repositório inclui [testes de operações](https://github.com/deepseek-ai/DeepGEMM-Ascend/tree/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests). A BIG CHANGE analisou a documentação e o código, mas não executou a compilação nem os kernels.

## Até onde chegam os benchmarks

A DeepSeek indica medições num Ascend 950DT com CANN 9.20, usando `bench_msprof` com a cache L2 fria. Para uma forma de multiplicação matricial densa BF16, M=4096, N=7168 e K=16384, a [tabela de desempenho ](https://github.com/deepseek-ai/DeepGEMM-Ascend#performance)indica 2 229,9 microssegundos, 431 TFLOPS e 99,8% do limite de hardware referido nessa tabela. Para a mesma forma, indica 1 117,6 microssegundos e 861 TFLOPS para FP8×FP8. São medições dos kernels para tipos e formas específicos, não do débito de um modelo. A tabela também inclui resultados de GEMM agrupado, MQA, MegaMoE e prenorm com configurações próprias; os valores MegaMoE são médias de oito ranks, com paralelismo de especialistas de oito, encaminhamento top-k de seis e um especialista partilhado.

O [código de teste ](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py)compara as saídas GEMM com referências geradas e usa uma verificação cruzada ACLNN nos casos densos suportados. Omite explicitamente essa comparação ACLNN adicional em algumas formas e receitas. O código e os testes publicados permitem analisar as afirmações, mas a BIG CHANGE não reproduziu de forma independente os valores do README. O lançamento não apresenta um benchmark comparável com outra stack de aceleradores, uma comparação de custos nem um resultado de serviço de ponta a ponta.

## A grande mudança

A DeepSeek publicou o código dos kernels DeepGEMM Ascend para a série Ascend 950.

Os programadores podem analisar e compilar operações GEMM conhecidas e operações relacionadas com modelos nesse hardware. O lançamento documenta o CANN 9.20 e uma disposição de fatores de escala específica do Ascend.

As equipas com Ascend 950 passam a dispor de código de kernels para avaliar com as formas dos seus próprios modelos. A DeepSeek indica resultados próximos do limite numa configuração de teste Ascend 950DT; a BIG CHANGE não executou os kernels.

O desempenho de aplicações completas, o suporte para outros dispositivos Ascend e os custos operacionais continuam por determinar.

## Fontes e leituras adicionais

- [Repositório e README do DeepGEMM Ascend](https://github.com/deepseek-ai/DeepGEMM-Ascend): nota de lançamento de 30 de setembro, requisitos, afirmações sobre a interface e tabelas de benchmarks produzidas pelo projeto. O README é uma fonte primária dos responsáveis pelo projeto, não uma validação independente.
- [Exportações do pacote](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py) e [configuração de compilação](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/setup.py): versão, funções Python públicas, dependências declaradas e ligação da compilação a partir do código-fonte no commit inicial.
- [Banco de testes GEMM](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py): como o repositório verifica as saídas e invoca o profiler, incluindo as condições em que uma comparação ACLNN é omitida. Estes ficheiros não reproduzem de forma independente os valores publicados.

## Sources

- [DeepSeek AI, repositório e README do DeepGEMM Ascend](https://github.com/deepseek-ai/DeepGEMM-Ascend) — Registo primário de interfaces, requisitos, instalação e benchmarks produzidos pelo projeto; os valores publicados não são resultados independentes.
- [Commit público inicial](https://github.com/deepseek-ai/DeepGEMM-Ascend/commit/8491bbb4b8c02a094a2318965f50c70438a3e73c) — O commit público inicial está datado de 01:07 UTC; foi utilizado para fixar a revisão da fonte e verificar a hora do lançamento.
- [Exportações do pacote Python DeepGEMM Ascend](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/deep_gemm/__init__.py) — Versão 0.1.0 e funções GEMM, MQA e MegaMoE expostas, além de controlos de disposição de escala e JIT; as exportações não comprovam o funcionamento nos nossos sistemas.
- [Configuração de compilação e banco de testes GEMM](https://github.com/deepseek-ai/DeepGEMM-Ascend/blob/8491bbb4b8c02a094a2318965f50c70438a3e73c/tests/common.py) — Lógica de teste, referências de correção e verificações ACLNN condicionais; analisar o código não equivale a reproduzir um benchmark.
Newsletter BIG CHANGE

A perspetiva geral, ao seu ritmo.

Histórias recentes sobre IA e robótica, mudanças que vale a pena acompanhar e ideias práticas para utilizar. Escolha um briefing diário, um resumo semanal ou uma perspetiva mensal.