实测 DeepSeek V4 Pro:后训练重做后 Agent 能力大幅提升;1M 上下文靠外推但尾部无衰减。真正值得注意的是开源的 Harness——极简工具、插件化主循环,甚至让模型在运行中自己写工具,DeepSeek 的下一个目标是代理自进化。
不管哪个时代,人都会遇到同一道题:面前的问题太复杂,资源和时间却不够,必须决定先做哪个、放弃哪个。从黑格尔到毛泽东的《矛盾论》,这套思想最终落到一个具体问题上:复杂事物中的矛盾很多,真正的关键是找到决定其他矛盾的主要矛盾。今天的大模型行业同样如此。
我们对 DeepSeek V4 Pro 和 Harness 做了几轮实测:接口探针、七次编码任务(其中四次是控制变量的对照)、把上下文压到 92 万 token 的位置测试,外加 19.8 万行源码和 21.7 万行测试的阅读。试图回答四个问题:Pro 到底强在哪?为什么接入其他 Harness 会"降智"?使用成本能否量化?Harness 解决什么问题?
Pro 和 Flash 有多个版本。对比配置,Pro 在深度、宽度、注意力、专家池和专家内部宽度上都有提升,但这些维度在预训练阶段就已定死。一个彩蛋是:DeepSeek Harness 的出厂默认模型写的是 flash。
另一个关键线索:v4-Pro-Preview 的 Terminal Bench 2.0 只有 67.9。7 月 31 日 Flash 转正时,同一张表里 Flash 是 82.7,Pro-Preview 是 72.1——Flash 的 Agent 能力比分比当时的旗舰还高。合理推测 DeepSeek 在 Flash 上跑通了新的后训练方法,然后把 Pro 回炉重造。到 v4-Pro-0813,Terminal Bench 2.1 从 72.1 涨到 87.9,DeepSWE 从 12.8 涨到 62.7。我们自造的两道题,六次运行全部满分。

但官方自测表的另一半被忽略了:Kimi K3 在多数 agentic 项上仍领先 0813,Terminal Bench 88.3 对 87.9。Pro 总参是 Flash 的 5.6 倍,激活参数 3.8 倍,换来的只是个位数领先。Flash 才是 DeepSeek 认定的主力性价比档,Pro 是上限档。
DeepSeek 的 1M 上下文来自 Hugging Face 配置:65536 × 16 = 1,048,576。它是在 64K 基础上用 YaRN 外推 16 倍。同标 1M 的 Kimi K3 换了注意力机制,GLM-5.2 把 rope_theta 拉到 800 万,只有 DeepSeek 明确用了外推。

外推的长上下文通常会在窗口后段衰减。我们在 385 万字符(约 92 万 token)的语料里埋了十条可客观判对错的事实,位置从 5% 到 95%,结果 10/10 全部命中,零编造。也就是跑到 1440 米还没掉速。不过官方给 Claude Code 的接入建议把自动压缩窗口设在 768K,显然不建议跑满。
第三方评测机构 Artificial Analysis 把 Pro 的输入价标为 expensive:同类中位数每百万 token $0.33,它要 $1.32。但每个任务均价 $0.25,在 106 个开源模型里第二低。比它强的 Kimi K3 每任务 $0.84,Claude Opus 5 是 $2.34。

真正省钱的是缓存。92 万 token 的上下文,第一次提问花了约 ¥9,之后四次加起来约 ¥0.28。我们四次编码任务的缓存命中率在 93% 到 98%。8 月 17 日涨价,涨幅最大的是缓存命中价(6 到 12 倍),最受伤的反而是把缓存用得最好的人。
网友反馈把 V4 Pro 接入 Claude Code 后明显变差。实测发现是官方路由导致的:DeepSeek 做了一层模型名翻译,Anthropic 三档被压成两档——claude-opus 对应 Pro,claude-sonnet 和 claude-haiku 都对应 Flash。问题在于 Sonnet 在 Anthropic 那边是干活主力,能力离 Opus 更近,却被归到 284B 的 Flash。非 claude 开头的名字会直接报 400,只有 claude-* 前缀才会静默映射。老教程里的 claude-3-opus 这类旧名字也很可能落到 Flash。

计费上它是按 Flash 计价,不是偷钱的问题,但开发者会误以为自己在用 1.6T 的旗舰,实际是混合体。正确做法是显式覆盖 ANTHROPIC_MODEL 等四个环境变量。
8 月 13 日晚发布 V4 Pro 后 76 分钟,DeepSeek 开源了 Harness。官方跑分用的"极简模式"里,模型只有两个工具:一个持久 bash、一个字符串替换编辑器;上下文压缩关闭;系统提示词只有一句话;空闲超时 48 小时。两道题我们照跑都做对了,但极简模式比标准模式多走 55% 的步数、多花 58% 的成本。它用步数换工具数,少即是贵。

更有意思的是"一切皆插件"。模型适配器、工具注册表、会话日志、沙箱策略,连派活的主循环本身都是插件,都能从配置里换掉。它甚至内置五个工具,让模型在运行中的进程里自己写插件、挂载、执行——相当于允许一个 App 在运行时自己写一个新 App 并立刻装进系统。官方对此很坦诚:沙箱只隔离全局对象,不是安全边界,要当作 bash 权限对待。

免费获取企业 AI 成熟度诊断报告,发现转型机会
我们还实测了它的子代理功能,dsh 确实能把 Claude Code 拉起来当小弟干活。不过委派连续两次失败,模型自动降级用普通子代理完成任务,并主动交代了换工具的原因。
dsh 不是开箱即用产品。它没有推荐设置、没有默认模式,Issues 是关闭的,文档建议"用一个 agent 来探索这个代码库"。它更像 AOSP——只提供平台,不替你做判断。DeepSeek 把选择权交给用户的同时,也把做选择需要的认知成本一并交了出去。如果你只是想要一个好用的模型,用 API 接你现在的工具就行,不必装 dsh。

回头看,V4 Pro 和 Harness 最有意思的或许不是模型又强了多少。当 AI 可以独立完成复杂工作后,真正稀缺的不再是更强的模型,而是知道自己究竟想让它做什么,以及愿意为这种自由承担什么样的代价。
原文链接:雷锋网
本文由前途科技编辑整理
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断