过去几年里,DeepSeek 创始人梁文锋极少以第一作者或通讯作者身份出现在动辄上百人署名的旗舰模型大报告中,但他始终把名字签在 MLA 注意力、MoE 路由机制、mHC 拓扑流形、DSpark 推理调度算子、DSec 智能体沙盒等最底层的原子技术论文上。

这 11 篇署名论文,串联起了一部直击大模型行业痛点、拆解物理与数学限制的技术演进史。
效率破局:打破算力与能力的线性绑定
2024 年初,大模型行业深陷算力规模军备竞赛。稠密模型的 Scaling Law 几乎等同于“烧钱定律”,OpenAI、Google 等巨头动辄投入万卡集群与数亿美元,初创公司沿着此路线追赶举步维艰。
梁文锋团队的第一波动作,直接瞄准“算力与能力线性绑定”的底层规则。
- 《DeepSeek LLM》:2024 年 1 月发布,团队证明盲目堆砌模型参数并非最优解,提升数据质量与密度配比能带来更强能力。仅用 67B 参数版本,就在多项基准测试中超越了当时的开源标杆 Llama-2 70B。
- 《DeepSeekMoE》与《DeepSeek-V2》:团队重构了传统 Transformer 架构。通过细粒度专家动态路由与共享专家隔离,DeepSeekMoE 将训练开销降低了 42.5%;首创的 MLA(多头潜在注意力)机制利用低秩潜在向量压缩,将 KV Cache 体积压缩了 93.3%。DeepSeek-V2 以比肩顶级模型的性能和极低成本,引爆了全行业 API 价格战,让开源社区重新拥有了竞争力。
能力击穿:冲击闭源模型的智力高地
度过生存期后,团队开始以极低成本全面对齐闭源模型的顶尖表现。
- 《DeepSeek-Coder-V2》:2024 年 6 月推出,通过注入 6 万亿高质量代码与数学数据,支持编程语言扩充至 338 种,上下文窗口拉升至 128K,在 HumanEval 等基准上全面超越当时的顶级闭源模型,且推理价格压到仅为竞品的几百分之一。
- 《DeepSeek-V3》:2024 年底,团队仅耗时不到 2 个月、凭借 2048 块 H800 显卡就训出 671B 参数模型,纯训练物料成本仅 560 万美元。论文通过无辅助损失的专家负载均衡、FP8 混合精度训练以及“数值计算与数据通信”并行重叠,将硬件空闲压至极限。
- 《DeepSeek-R1》:2025 年初发布的 R1 彻底颠覆了深度推理领域。团队提出 GRPO(组相对策略优化)算法,证明无需大规模人工标注(SFT),仅凭纯强化学习就能自主涌现思维链(Chain of Thought);R1-Zero 更实现了从零冷启动的强化学习探索。
- 《Native Sparse Attention》与《Insights into DeepSeek-V3》:随后,团队用 Triton 语言重写底层硬件算子,提出适配 NVIDIA GPU Tensor Core 的原生稀疏注意力(NSA),前向传播速度提升 9 倍;并在体系结构顶会发表论文,从底层拆解大模型训练的内存墙与通信墙,给下一代芯片设计提供实证指南。
深水区攻坚:用数学重构超深层网络底座
当模型扩展到上百层,梯度在长距离传递中极易失控暴涨或衰减,传统的残差连接(Residual Connection)开始出现局限,训练频现 Loss Spike。
2025 年末,团队在 《mHC: Manifold-Constrained Hyper-Connections》 论文中提出了“流形约束超连接”。该方法为层间信号多路传输架设了严格的数学边界,强制要求层间映射矩阵落在 Birkhoff 多面体流形内,保持整体数值尺度守恒,从拓扑和数学底层解决了超深层网络训练不稳定的难题,为更超大规模的模型夯实了地基。
布局智能体基础设施:从模型到环境
进入 2026 年,全行业聚焦智能体(Agent)生态,竞争核心从单次模型响应转向长流程调度与交互试错。
- 《DSpark》:针对高并发场景下的生成延迟,团队提出 DSpark 推理算子,动态调整生成节奏——有把握处提速,易错处降速,将事后回滚变为事前规避,在高并发下将个人生成速度提升 60% 至 85%。
- 《DSec》:Agent 强化学习需要数以百万计的可执行环境。DeepSeek 发布的 DSec 自动化沙箱基础设施,每日可调度约 300 万个沙箱,并发承载 38 万个实例,通过严密隔离防止作弊,为大规模智能体训练提供了生产级底座。
从底层的 MoE 与 MLA 降本,到 GRPO 推理涌现,再到网络拓扑数学约束与 Agent 沙箱体系,梁文锋署名的这一系列论文呈现出一条清晰的技术主线:避开简单的算力堆砌,用精密的算法与系统工程直击底层瓶颈,实现更普惠的高性能计算范式。