Anthropic将Claude缓存读取价从每百万token 1美元降至0.25美元,降幅75%;典型任务成本降约25%,高度Agent化任务最高降45%。当“记忆成本”被打下来,长时Agent的商业化才真正开始。
Ramp 的工程师盯着监控屏,一条机器学习任务曲线平稳跑了 38 小时,全程无人值守。他们第一次觉得,让 AI“睡着觉干活”,终于不再是实验室里的行为艺术。
支撑这场实验的不是 OpenAI 越来越便宜的算力组合拳,而是 Anthropic 悄悄改的一个小数点:缓存读取价从每百万 token 1 美元降至 0.25 美元,降幅 75%。
2026 年 9 月,大家盯着 Claude Fable 5.1 翻倍的跑分,华尔街量化基金和硅谷极客真正失眠的,是价格表上最不起眼的那行字。同一套底层模型被拆成两条发布轨道:Fable 5.1 向公众与企业全量开放;Mythos 5.1 只对通过审核的网络安全和生命科学伙伴放行。输入输出价格分文未动,缓存读取价被单独砍穿。
一直以来,模型定价围绕“单次智能”展开,输入多少、输出多少,比谁单价低。OpenAI 2026 年 6 月发布 GPT-5.6 家族,旗舰 Sol 输入 5 美元、输出 30 美元;7 月 Luna 降价 80%;8 月 Sol 再降两成,一路压低“单位智能”的价格。Anthropic 反其道而行,Fable 5.1 输入价仍为每百万 token 10 美元,输出价 50 美元,与上代持平,普通输入甚至是 Opus 5 的两倍;但缓存读取价从 1 美元降到 0.25 美元,只相当于正常输入价的 2.5%,远低于其他模型动辄 10% 的折扣系数。
这很反直觉:新想法仍收最贵的税,旧记忆却给最狠的补贴。长时 Agent 的成本曲线,主要不是“生成新 token”,而是“把已处理过的上下文再读一遍”。一个持续几小时、几十小时的任务,真正新产生的 token 很少,绝大多数是反复读取的旧状态。Anthropic 的账本是:典型任务整体成本降约 25%,高度 Agent 化任务最高降约 45%。
OpenAI 争夺的是单次智能的性价比高地;Anthropic 赌的是,Agent 的下一阶段不是更快答对一道题,而是连续几十小时不跑偏做完一件事。在那个世界里,决定账单的不是模型多聪明,而是它记东西、读旧东西有多便宜。
Fable 5.1 在 Terminal-Bench-Science 0.1 拿到 52.6%,上代只有 24.7%;OpenAI 旗舰 Sol 是 22.4%,自家 Opus 5 是 29.0%。AutomationBench 从 17.1% 涨到 31.4%,Terminal-Bench 4.0 从 42.0% 涨到 55.8%,Mythos 5.1 做到 60.9%。关键细节是,这些分数在“生产级安全防护开启”时跑出来的,防护一旦出手就记零分,意味着真实上限只会更高。
客户侧的故事也更具体:Jane Street 量化研究主管说,Fable 5.1 在漫长的多步任务里始终可读;Millennium 一位对冲基金经理发现,一个百万分之一概率触发、团队四五年都解释不了的罕见崩溃,只有 Fable 5.1 通过反汇编第三方库和比对 core dump 找到了根因;Ramp 记录了一次 38 小时无人值守任务,模型半夜自行纠正问题、启动六组实验后带着方案回来。
把证据串起来看,Fable 5.1 的翻倍不是模型更大,而是更能撑:长链条上少崩、少偏、少让人返工。能三小时答对难题,和能三天不跑偏,是两种产品。
Fable 5.1 与 Mythos 5.1 是同一模型,只是防护等级不同。前者全量开放,后者只进“可信访问计划”,护栏专为网络安全和生命科学调校。也就是说,Anthropic 把能力与护栏解耦,让同一个最强模型以不同安全配置进入不同市场。
数据保留政策也是同一思路。新推出的 Enterprise Frontier Safeguards 能让企业把监控数据放在自己控制的云设施里,达到等于“零数据保留”的隐私水平,同时保留顶级的对抗性滥用防护,今年秋天起分阶段落地。同时,网络安全领域对良性内容的误拦减少约 60%,基础生物学和医学问题的降级率降低约 85%。
安全不再是一张贴在模型外面的补丁,而是可按客户分层配置的参数:普通企业少拦一点,高风险领域多拦一点。同一台引擎,不同的方向盘。
上半场的竞争是单次智能的价格战。OpenAI 把 Luna 压到输入加输出合计每百万 token 1.4 美元,靠训练成本、推理效率和规模优势打普惠降价。Anthropic 这记缓存降价,把战场彻底移到“记忆”上。
Cognition 联创说得很直接:发布当天就把 Devin 里的 Opus 5 流量迁到 Fable 5.1,因为新缓存读价让 Fable 级模型对长时工作负载经济可用了。此前,不少重度负载因为缓存成本不划算,被迫降级到次一档模型。Anthropic 真正降的是“把最强模型当常驻 Agent”的门槛,让客户从“够用就好”走向“最强也养得起”。
短期内 OpenAI 未必伤筋动骨,毕竟它有规模优势也有自己的缓存折扣。真正危险的是夹在中间层的模型厂商:既没有 OpenAI 的规模做普惠降价,也没有 Anthropic 的纵深重构成本结构。当头部开始动“记忆成本”这个隐形变量,它们在单次智能和持续智能两条线上同时失血。
对用户和开发者,评估模型不能只看输入输出价签,还要算负载里有多少是反复读取的上下文。一次性问答受这次降价影响不大;跑几小时的 Agent,这 75% 可能比任何跑分都值钱。
过去我们看 MMLU 分数,是脑容量时代;后来比每百万 token 价格,是脑转速时代。Anthropic 用 0.25 美元划出新起跑线——记忆的租金。当模型聪明到能连续工作数十小时,决定它能否大规模落地的,不是想得多快,而是记得多便宜。
当 AI 的记忆比人类的遗忘还便宜,Agent 才真正从玩具变成工具。这场定价战回答的不是“AI 能做多难的事”,而是“我们能放心让 AI 做多久的事”。Anthropic 把问题摆上了台面,台面下的答案,将决定未来一年 Agent 经济到底属于谁。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断