DeepSeek 正式开源面向华为昇腾平台的基础设施组件,涵盖 TileLang 编译工具、高性能算子库与 DeepEP 分布式通信库。此举为国产大模型与算力平台的软硬深度协同提供了全新选择。

DeepSeek 正式开源了面向华为昇腾算力平台的基础设施组件,全面对标其此前在 GPU 平台开源的技术堆栈,涵盖高级语言编译工具 TileLang、高性能计算库以及分布式通信库。
这次开源对国内大模型基础软件生态具有关键意义,标志着主流开源大模型团队正进一步深化对国产算力底座的原生支持。
在核心算子层面,DeepSeek 此次发布了 DeepGEMM、FlashMLA、TileKernel 和 DeepSelect 等高性能昇腾算子库组件,以及分布式通信库 DeepEP。
昇腾方面通过开放的 Ascend C API 接口,允许开发者对访存路径和计算流水线进行底层深度调优,完成高性能算子开发。同时,基于开放的 Ascend C 接口与 PTO ISA 底层指令集,昇腾平台全面支持了 DeepSeek 的 TileLang 编程体系,既兼顾了资深开发者精细手工调优的需求,也能顺畅对接高级语言的自动编译。
在硬件与网络架构方面,华为与 DeepSeek 团队联合定义了昇腾超节点 SuperPoD Flex 以及 UBL128 组网方案:
依托全互联的 UBL128 超节点,昇腾提供了 ASC-COMM 高性能自定义通信编程库。DeepSeek 团队据此打造了高性能 DeepEP 通信库,覆盖 EP、CP、PP 与 FSDP 等多种并行模式下的通信算子。实测互联带宽表现优异:Dispatch 达到 375 GB/s,Combine 达到 347 GB/s,性能表现已逼近硬件物理极限。
为推动开发者基于昇腾 950 及超节点集群落地部署,双方的联合创新成果已在华为 CANN 社区全面开源,覆盖大 EP 低延时推理、单卡/单机部署、大规模训练、超长文本 KV cache 池化及智能体强化学习(Agentic RL)等多种场景。
在大规模推理测试中,基于 EP32 部署策略且在离线推理模式下(128K 上下文长度,投机接受率 0.85,不计 Serving 调度开销),DeepSeek-V4.1-Flash 的纯模型性能表现如下:
双方相关的开源技术报告与实践代码已同步公开,包括通算并行算子开发实践、超节点部署推理优化指南、PyTorch 原生预训练实践以及单机 LoRA 微调方案等,为开源社区提供了从底层通信到上层模型部署的完整软硬协同参考范式。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断