算力#芯片#模型推理

DeepSeek 开源昇腾基础组件:V4 系列算子全部有了昇腾实现

DeepSeek 9 月 30 日开源六个昇腾基础组件,覆盖矩阵计算、通信与算子编译,称 V4 系列 NVIDIA 算子均有昇腾实现。

橙色氧化硅晶圆的微距特写

DeepSeek 9 月 30 日在 GitHub 的 deepseek-ai 组织下开源六个昇腾(Ascend)基础组件仓库,与算子编译语言 TileLang 一起,把 V4 系列模型的算子层完整搬上华为昇腾芯片;华为同日经量子位发布授权稿,给出配套实测数据。这是继模型权重之后,DeepSeek 第一次成建制公开芯片侧的软件栈。

事实部分

  • 六个仓库:DeepGEMM-Ascend(矩阵计算)、DeepEP-Ascend(跨设备通信,官方称 Dispatch 375 GB/s、Combine 347 GB/s)、TileKernels(向量化算子)、FlashMLA(稀疏注意力)、DeepSelect(数据选择),均发布在 github.com/deepseek-ai 下。
  • TileLang:高级算子编译语言(tile-ai/tilelang)。DeepSeek 称 V4 系列的 NVIDIA 算子大多用它编写,且每一条都有昇腾对应实现——这是「全部移植」说法的来源。
  • CANN 配套文档:华为在 gitcode 的 CANN 社区维护 cann-recipes-infer / cann-recipes-train / torchtitan-npu 等配方库,覆盖推理通信、量化训练、LoRA 与 Agentic RL 部署。
  • 实测口径:华为给出 DeepSeek-V4.1-Flash 离线推理数据(EP32、128K 上下文):TPOT 5 毫秒时每卡 2,469 token/s,10 毫秒时 5,102 token/s;并称 128 卡超节点提供 3.2 Tbps 互联。
  • 信源说明:量子位那篇是华为授权转载;仓库层面的数据以 GitHub 仓库文档为准,机器之心与华为稿的数字相互一致,但均无独立第三方复测。

编辑判断

模型开源常见,算子层开源少见:训练框架可以换,算子和芯片的耦合最难搬。DeepSeek 把整套 V4 算子移植公开,等于替昇腾做了一次可复现的性能背书,也回应了中国审批英伟达芯片采购背景下的路线问题。采购与部署决策者值得等第三方在真实业务负载上复测这组吞吐数字,再对照同一周公开的 DSec 训练基建看 DeepSeek 的软硬栈全貌。