Nate B. Jones 用 OpenRouter 与 OpenAI 的公开数据推翻了一个默认假设:Agent token 用量半年涨 14 倍、每消耗 5 个 Agent token 人类才消耗 1 个,而检查产出的仍然是人。真正在变的不是工作量,是工作的种类——从执行,变成决定什么该被执行、以及检查它做没做对。
Agent 会替你干活,所以你需要的人更少——这是过去两年所有 AI 采购决策背后的默认假设。
AI 战略分析师 Nate B. Jones 在 8 月 28 日发布的一期 31 分钟视频里,用一组公开数据把这个假设整个推翻了。他的结论是:Agent 没有把工作拿走,它在制造工作,而且制造得比它干掉的多。
这期视频在中文圈几乎没有被转述,而它讨论的问题——企业买了 Agent 之后到底发生了什么——正是国内企业现在最需要的那类实地观察。
Jones 引的第一组数字来自 OpenRouter:Agent 的 token 用量在今年 2 月到 8 月之间涨了 14 倍。现在每消耗 5 个 Agent token,人类才消耗 1 个。
OpenAI 的口径也一致:Codex 的重度用户每天产生 60 小时以上的 Agent 活动。
Jones 在这里点出了那个被跳过的问题:
没有人看得完 60 小时的工作。
这句话是整期视频的支点。Agent 的产出在指数级增长,而检查产出的仍然是人。产出涨了,检查的工作量就跟着涨——这不是效率提升,是工作量转移。

Jones 给出的三步机制:执行扩张 → 监督上移一层 → 检查与恢复仍归人类。图片来源:Nate B. Jones, "Agents Aren't Taking Your Jobs. They're Creating More Work Instead."
视频最有价值的部分是把"企业用 Agent"拆成了三个完全不同的场景。这个拆法解释了一个长期存在的困惑:为什么同样的模型,有的公司说效果极好,有的说根本用不起来。

个人(一人 + 一个 Agent)、小微企业(Agent + 供应商)、大企业(部署团队)。图片来源:Nate B. Jones 同期视频
个人最简单:一个人管一个 Agent,自己决定跑什么、自己验收。
小微企业是最难的一档。Jones 引了 OpenAI 那个覆盖一万家小企业的项目数据:只有 14% 的小企业主认为 AI 已经完整融入核心业务,而 73% 说他们需要更多培训和资源才能落地。
原因不难理解——小企业里懂业务的那个人,同时还要招人、销售、看账、处理当天坏掉的任何东西。他没有时间去当 Agent 的管理者。
于是出现了一个 Jones 观察到的模式:供应商接管了 AI 管理这份工作。 供应商选工作流、连软件、检查结果、改规则、汇报省了多少钱。
听上去很合理。但 Jones 指出了代价:
供应商现在对这家企业的一块核心业务负责了。
大企业反而更顺,原因不是模型更好,而是资本能把管理成本消化掉。OpenAI 的对比数据很直接:今年 1 月,重度企业用户人均输出 token 是普通用户的 2.6 倍;到 6 月,这个差距拉大到了 8.3 倍。这些公司使用插件的概率是 2 倍,使用 skills 的概率是 6 倍——意思是它们把模型接进了更多内部系统。
Jones 的判断是:
基础模型不是差别所在。两边都拿得到前沿智能。变的是公司在 Agent 周围做了多少工作。
视频里有一个反直觉的观察:律师事务所——大部分是小微企业——却是 Agent 采用率最高的行业之一。 Codex 在法律领域的使用量自 1 月起涨了约 108 倍,71% 的独立执业律师和 75% 的小型律所已经在用 AI。
Jones 给的解释是"可验证领域"(verifiable domain):法律和编程一样,对错是可判定的。
他举了华盛顿特区一家人身伤害小律所 Trombly & Singer 的例子:用 EvenUp 审阅医疗记录、起草索赔函初稿,一个工作流每月省下约 40 个人工小时,避免了再招一个人。
关键不在于 Agent 有多准。Jones 特意提到一个基准测试:给系统 1,300 段法律文书摘录找引用错误,最好的系统仍然会漏掉细微问题。律师还是得逐项核对。
差别在于——
他们有办法验证。他们本来就有这个流程,本来就要做这件事。既然如此,为什么不让 Agent 来做?
免费获取企业 AI 成熟度诊断报告,发现转型机会
这是全片最实用的一条判据:决定 Agent 能不能落地的,不是任务难不难,而是「做对了没有」能不能便宜地判定。
Jones 给了一个具体预测:随着 Agent 数量增长,一个十人团队将要管理 10 到 20 个 Agent。

团队 10 人 / Agent 10–20 个 / 谁来分配它们?Jones 称之为「管理税」。图片来源:Nate B. Jones 同期视频
到那个规模,一个负责人已经无法定义所有 Agent 的行为,协调问题会自己冒出来。他把这个称为**「Agent 管理税」**,并预测 2027 年会出现一批专门帮企业管理 Agent 的创业公司。
与之配套的是一个人的位置变化。业内一直讲"human in the loop"(人在回路中),Jones 认为 2026 年正在发生的是人正在移到回路之上(above the loop):
他们决定 Agent 要做什么、谁可以带审批地行动、哪些失败是要紧的、接下来发生什么。
而承担这件事的是中层管理者——Jones 举了亚马逊 L7 这个层级——他们从来没有被训练过如何分配和管理 Agent。
Jones 讲的是美国市场,但他的框架里有三条对国内直接适用,而且落差可能更大。
第一,「可验证领域」这条判据国内还没被普遍使用。 国内企业选 AI 落地场景,主流做法仍然是按"哪个部门叫得响""哪个流程最耗人"来排。但按 Jones 的框架,正确的第一问是:这个场景里,"做对了"能不能被便宜地判定? 判定不了的场景,再耗人也不该排在前面——因为省下的执行时间会被验证时间吃掉。
第二,供应商接管 AI 管理这件事,在国内可能更普遍。 国内的 AI 落地服务商大量承接"交钥匙"项目,而按 Jones 的观察,这等于把一块核心业务的判断权交出去了。这不一定是错的选择,但企业至少应该知道自己交出去的是什么,以及合同到期后自己还剩下什么能力。
第三,「管理税」这项成本还没有进入国内的 ROI 测算。 现在通行的算法是"Agent 替代 N 个人力 = 省 N 份工资"。但如果 Jones 的观察成立——执行扩张、监督上移、检查仍归人——那么真实的账应该再加一项:为管理这些 Agent 新增的人力和流程成本。这项成本随 Agent 数量增长,而不是随之下降。
这期视频没有说 Agent 没用。Jones 自己的立场很清楚:Agent 正在做越来越多的事,这是事实。
他要纠正的是那个默认假设——"Agent 干活 → 我需要的人更少"这个推导,在他看到的所有规模上都不成立。
真正在变的不是工作量,是工作的种类:从执行,变成决定什么该被执行、以及检查它做没做对。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断