前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.01 · 00:00/6 MIN/编译自 雷锋网/0 阅读

DeepSeek V4 Pro 深拆:后训练重做,Harness 指向自进化

实测 DeepSeek V4 Pro:后训练重做后 Agent 能力大幅提升;1M 上下文靠外推但尾部无衰减。真正值得注意的是开源的 Harness——极简工具、插件化主循环,甚至让模型在运行中自己写工具,DeepSeek 的下一个目标是代理自进化。

不管哪个时代,人都会遇到同一道题:面前的问题太复杂,资源和时间却不够,必须决定先做哪个、放弃哪个。从黑格尔到毛泽东的《矛盾论》,这套思想最终落到一个具体问题上:复杂事物中的矛盾很多,真正的关键是找到决定其他矛盾的主要矛盾。今天的大模型行业同样如此。

我们对 DeepSeek V4 Pro 和 Harness 做了几轮实测:接口探针、七次编码任务(其中四次是控制变量的对照)、把上下文压到 92 万 token 的位置测试,外加 19.8 万行源码和 21.7 万行测试的阅读。试图回答四个问题:Pro 到底强在哪?为什么接入其他 Harness 会"降智"?使用成本能否量化?Harness 解决什么问题?

模型:Pro 很可能是重做了后训练

Pro 和 Flash 有多个版本。对比配置,Pro 在深度、宽度、注意力、专家池和专家内部宽度上都有提升,但这些维度在预训练阶段就已定死。一个彩蛋是:DeepSeek Harness 的出厂默认模型写的是 flash。

另一个关键线索:v4-Pro-Preview 的 Terminal Bench 2.0 只有 67.9。7 月 31 日 Flash 转正时,同一张表里 Flash 是 82.7,Pro-Preview 是 72.1——Flash 的 Agent 能力比分比当时的旗舰还高。合理推测 DeepSeek 在 Flash 上跑通了新的后训练方法,然后把 Pro 回炉重造。到 v4-Pro-0813,Terminal Bench 2.1 从 72.1 涨到 87.9,DeepSWE 从 12.8 涨到 62.7。我们自造的两道题,六次运行全部满分。

官方 V4 家族自测分数

但官方自测表的另一半被忽略了:Kimi K3 在多数 agentic 项上仍领先 0813,Terminal Bench 88.3 对 87.9。Pro 总参是 Flash 的 5.6 倍,激活参数 3.8 倍,换来的只是个位数领先。Flash 才是 DeepSeek 认定的主力性价比档,Pro 是上限档。

1M 上下文是外推出来的

DeepSeek 的 1M 上下文来自 Hugging Face 配置:65536 × 16 = 1,048,576。它是在 64K 基础上用 YaRN 外推 16 倍。同标 1M 的 Kimi K3 换了注意力机制,GLM-5.2 把 rope_theta 拉到 800 万,只有 DeepSeek 明确用了外推。

Hugging Face 上的 rope_scaling 配置

外推的长上下文通常会在窗口后段衰减。我们在 385 万字符(约 92 万 token)的语料里埋了十条可客观判对错的事实,位置从 5% 到 95%,结果 10/10 全部命中,零编造。也就是跑到 1440 米还没掉速。不过官方给 Claude Code 的接入建议把自动压缩窗口设在 768K,显然不建议跑满。

单价偏贵,任务便宜,省钱在缓存

第三方评测机构 Artificial Analysis 把 Pro 的输入价标为 expensive:同类中位数每百万 token $0.33,它要 $1.32。但每个任务均价 $0.25,在 106 个开源模型里第二低。比它强的 Kimi K3 每任务 $0.84,Claude Opus 5 是 $2.34。

AA 每任务成本与智能指数

真正省钱的是缓存。92 万 token 的上下文,第一次提问花了约 ¥9,之后四次加起来约 ¥0.28。我们四次编码任务的缓存命中率在 93% 到 98%。8 月 17 日涨价,涨幅最大的是缓存命中价(6 到 12 倍),最受伤的反而是把缓存用得最好的人。

为什么换 Harness 会"降智"?

网友反馈把 V4 Pro 接入 Claude Code 后明显变差。实测发现是官方路由导致的:DeepSeek 做了一层模型名翻译,Anthropic 三档被压成两档——claude-opus 对应 Pro,claude-sonnet 和 claude-haiku 都对应 Flash。问题在于 Sonnet 在 Anthropic 那边是干活主力,能力离 Opus 更近,却被归到 284B 的 Flash。非 claude 开头的名字会直接报 400,只有 claude-* 前缀才会静默映射。老教程里的 claude-3-opus 这类旧名字也很可能落到 Flash。

Anthropic 三档压两档的映射

计费上它是按 Flash 计价,不是偷钱的问题,但开发者会误以为自己在用 1.6T 的旗舰,实际是混合体。正确做法是显式覆盖 ANTHROPIC_MODEL 等四个环境变量。

Harness:要么极简,要么让模型自己改自己

8 月 13 日晚发布 V4 Pro 后 76 分钟,DeepSeek 开源了 Harness。官方跑分用的"极简模式"里,模型只有两个工具:一个持久 bash、一个字符串替换编辑器;上下文压缩关闭;系统提示词只有一句话;空闲超时 48 小时。两道题我们照跑都做对了,但极简模式比标准模式多走 55% 的步数、多花 58% 的成本。它用步数换工具数,少即是贵。

Harness 极简模式配置

更有意思的是"一切皆插件"。模型适配器、工具注册表、会话日志、沙箱策略,连派活的主循环本身都是插件,都能从配置里换掉。它甚至内置五个工具,让模型在运行中的进程里自己写插件、挂载、执行——相当于允许一个 App 在运行时自己写一个新 App 并立刻装进系统。官方对此很坦诚:沙箱只隔离全局对象,不是安全边界,要当作 bash 权限对待。

插件工具集的 README

标签:DeepSeekV4 Pro后训练开源

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

特努斯上任第一天:苹果悄悄放弃了自研大模型这条路
置顶

特努斯上任第一天:苹果悄悄放弃了自研大模型这条路

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来
置顶

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

我们还实测了它的子代理功能,dsh 确实能把 Claude Code 拉起来当小弟干活。不过委派连续两次失败,模型自动降级用普通子代理完成任务,并主动交代了换工具的原因。

把判断权还给你,连同成本

dsh 不是开箱即用产品。它没有推荐设置、没有默认模式,Issues 是关闭的,文档建议"用一个 agent 来探索这个代码库"。它更像 AOSP——只提供平台,不替你做判断。DeepSeek 把选择权交给用户的同时,也把做选择需要的认知成本一并交了出去。如果你只是想要一个好用的模型,用 API 接你现在的工具就行,不必装 dsh。

交付的四级阶梯

回头看,V4 Pro 和 Harness 最有意思的或许不是模型又强了多少。当 AI 可以独立完成复杂工作后,真正稀缺的不再是更强的模型,而是知道自己究竟想让它做什么,以及愿意为这种自由承担什么样的代价。


原文链接:雷锋网
本文由前途科技编辑整理

Uber 智能体请求涨 9.4 倍、账单没涨:拆开看,这不是省钱教程,是治理教程
置顶

Uber 智能体请求涨 9.4 倍、账单没涨:拆开看,这不是省钱教程,是治理教程

//

24小时热榜

Keep 的瘦身经济学:月活降、净利转正
TOP1

Keep 的瘦身经济学:月活降、净利转正

特努斯上任第一天:苹果悄悄放弃了自研大模型这条路
TOP2

特努斯上任第一天:苹果悄悄放弃了自研大模型这条路

3

Anthropic发布企业前沿防护,客户掌控数据

7小时前
Anthropic发布企业前沿防护,客户掌控数据
4

ChatGPT医疗版新增Epic集成与公共数据插件

8小时前
ChatGPT医疗版新增Epic集成与公共数据插件
5

OpenAI 称 Astra 达到网络安全关键能力阈值

8小时前
OpenAI 称 Astra 达到网络安全关键能力阈值
6

AI原生企业如何将工作流转化为运营能力

8小时前
AI原生企业如何将工作流转化为运营能力
7

OpenAI支持加州青少年AI安全法案

15小时前
OpenAI支持加州青少年AI安全法案
8

中关村四十年:从电子一条街到AI原点社区

15小时前
中关村四十年:从电子一条街到AI原点社区
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断