DeepSeek V4.1 Flash彻底放弃旧架构,采用非对称CED结构与第二代压缩稀疏注意力,大幅降低长上下文下的KV Cache开销。这次底层重构由Agent产品DSH倒逼而成,标志着模型竞局已从单点参数转向真实任务入口与数据闭环。
DeepSeek V4.1 Flash上线后,在速度、准确度以及原生多模态能力上均有显著提升。
与此前的 V4 Flash 相比,V4.1 Flash 最根本的转变在于架构上的“推倒重来”——它摒弃了传统的结构,全面切换至全新的非对称设计。这意味着团队在 V4 时代积累的大量训练技巧、优化算子与工程适配经验,在 V4.1 中几乎全被推翻重做。
对于一家拥有数百人规模、追求工程效率的企业而言,冒着高昂的时间与研发成本重构核心架构,绝非一次简单的版本迭代。官方技术报告显示,旧有的模型架构已无法承载全新的训练目标——而这一新目标的核心,正是争夺 AI 智能体(Agent)的“入口”。
在传统开发流程中,往往是先有大语言模型,再根据模型特性去封装上层应用(Harness)。然而,DeepSeek V4.1 Flash 的架构却是被其生态工具 DSH(DeepSeek Harness)“反哺”催生的。
技术报告指出,V4.1 Flash 的后训练依然采用标准的监督微调(SFT)、强化学习(RL)以及在线蒸馏流程,核心算法并未大改,真正的变革发生在数据流水线:团队通过大规模自动合成 Agent 任务与环境,让模型在 6 种不同的 Agent 框架中反复探索试错,其中 DSH 是最关键的训练场。
为了适配 DSH 的运行模式,DeepSeek 彻底重新设计了底层模型结构:
为了解决输入过载问题,DeepSeek V4.1 Flash 引入了因果编码器-解码器架构(Causal-Encoder-Decoder,CED)。
在传统的 Decoder-only 架构中,所有网络层结构相同,每一层都必须同时承担读取输入与生成输出的职责,且各自独立维护一份 KV Cache。CED 架构则将 40 层语言主干拆解为分工明确的流水线:
这种解耦让记忆只需生成一次,解码器的全局 KV Cache 可直接从编码器的最终输出投影而来。搭配第二代压缩稀疏注意力机制(CSA2),不同层级之间得以共享键值与索引,最终将全局 KV Cache 压缩至 890 字节/Token,仅为 V4 Flash 的四分之一。
DeepSeek 这一转向并非孤例,腾讯姚顺雨主导的 Hy4 preview 此前也展示了类似的思路——让模型研发与内部真实的工程工具(如 CodeBuddy、WorkBuddy)深度协同,让真实任务直接回流至训练管线,实现工具与模型的双向进化。
相比之下,国内其他头部大模型团队则选择了不同的技术路径:
两种路线的差异在于:智谱与月之暗面倾向于在封闭可控的高拟真沙箱内完成能力跃升;而 DeepSeek 与腾讯则更强调通过客户端工具直接卡位真实场景,让模型在实战交互中持续吸收反馈。
伴随 V4.1 Flash 的发布,DSH 也迭代至 v0.1.5 版本。新版本不仅支持在保留原有 KV Cache 的前提下动态更新系统提示词(避免切换 Agent 角色时引发全量重算),还新增了显式文件交付、侧边栏即时预览等面向普通用户的工程化交互功能。
DSH 正在从早期依赖开发者自行折腾插件的框架原型,演变为一个标准化的生产力入口。对于用户而言,更换 API 接口只需要复制一段密钥,但习惯并沉淀在一个工作流产品中则具备极高的迁移门槛。
通过对底层模型架构的重构,配合上层客户端的体验铺平,DeepSeek 正试图以更低的推理成本和更深的产品粘性,将自己打造成 Agent 时代的系统级入口。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断