Anthropic凌晨发布Fable 5.1与Mythos 5.1,长时Agent任务性能翻倍,缓存读取价格下降75%。公司或于劳动节后公开IPO招股书,最快10月初上市,估值有望超2万亿美元。
Fable 5.1和Mythos 5.1,凌晨突然上线。上一代Fable 5几乎成了SOTA模型的代名词,光环未退,Anthropic已经开始自己卷自己了。

两款模型同时发布,Fable 5.1面向普通用户和企业,Mythos 5.1则把同一套前沿能力开放给“经过验证的网络安全和生命科学机构”。定价上,基础价格不变,Fable 5.1依然是10美元/百万输入Token、50美元/百万输出Token,但缓存读取价格砍掉了75%,从1美元/百万Token降到0.25美元/百万Token。性能提升则明显集中在长时间、多步骤的Agent任务上:Terminal-Bench-Science从24.7%涨到52.6%,AutomationBench从17.1%涨到31.4%。

比起模型本身,更值得注意的是发布时机——按The Information此前的披露,已秘密提交IPO文件的Anthropic可能在9月7日美国劳动节后公开招股书,9月中旬举行投资者日,最快9月底至10月初上市。这可能就是Anthropic公开递表前的最后一次重量级模型发布。
与此同时,Anthropic此前“明升实降”改额度的余波也出现在评论区。8月29日,Anthropic宣布9月14日起将标准周额度提高25%,但这个数字是相对5月以前的旧标准;与用户目前使用的临时额度相比,实际反而下降17%。有用户追问:能不能给出“更透明、更慷慨”的会话和每周额度?

规格上,Fable 5.1延续了100万Token上下文窗口和128K最大输出,基础价格不变。放到旗舰阵容里,它仍是最贵的一档:同样按100万输入+100万输出计算,Fable 5.1是GPT-5.6 Sol的2.5倍,GLM-5.3的10倍以上。Anthropic官方甚至建议,大多数任务优先用价格只有一半的Opus 5,只有高难度推理、长时间Agent任务或Opus 5不够用时再上Fable 5.1。

真正值得关注的是Agent持续运行的成本。Fable 5.1的缓存读取从1美元/百万Token降到0.25美元,相当于砍掉75%。缓存读取可以理解为:上下文被模型处理过之后,后续请求无需按完整输入价格重新读取。一个连续运行几个小时的Agent会反复读取系统提示词、代码库和此前处理过的上下文,任务越长,缓存读取占的成本越高。Anthropic用8月实际数据测算,相同任务从Fable 5换到5.1,典型工作负载整体成本预计下降约25%;复杂Coding和高度Agent化任务最高降约45%。也就是说,Anthropic没有把模型本身卖得更便宜,但把“让它长时间工作”这件事做得更便宜了。当然,基础价格摆在那里,有开发者提醒:即使缓存命中率很高,一次复杂Coding任务仍可能花掉20到50美元。

这种降价主要发生在API场景。对于订阅Claude Code的用户,另一套“额度账”刚引发争议:Anthropic之前临时把周额度提高了50%(持续到9月14日),现在宣布从9月14日起“永久提高25%”。若原始额度为100,用户目前实际拿到150,9月14日后变成125——名义上提高25%,相对现在实际额度反而减少了约17%。

从性能看,Fable 5.1的提升集中在需要连续调用工具、多步骤、检查中间结果再决定下一步的任务,而非“均匀分布”。Anthropic公布的数据中,Terminal-Bench-Science从24.7%提高到52.6%,直接翻倍;Terminal-Bench 4.0从42.0%提高到55.8%;AutomationBench从17.1%提高到31.4%。传统推理和Coding Benchmark的提升则温和得多:Humanity's Last Exam(不用工具)从57.8%到60.9%,CursorBench 3.2.0从70.5%到73.4%。




企业测试也指向同一结论。Browserbase的最难浏览器Agent Benchmark中,Fable 5.1完成82%的任务,Opus 5为74%,Fable 5只有57%。Ramp让Fable 5.1无人干预连续运行38小时:它发现此前一个机器学习实验受标签伪影影响,自行修正并启动6组并行实验跑了一整夜,带着新结果和下一步建议回来。Canva则在盲测中更偏好5.1的输出,还让Fable 5.1在Canva Code里做出了一个节奏与音乐拍点对应的游戏,这是其他模型没做到的。


免费获取企业 AI 成熟度诊断报告,发现转型机会

Mythos 5.1与Fable 5.1“identical”,只是为经过审核的用户提供更宽松的安全限制。因此两者在同一个Benchmark会有差异:比如Terminal-Bench 4.0上Fable 5.1为55.8%,Mythos 5.1为60.9%。Anthropic解释,部分网络安全任务触发了Fable的安全限制,并非底层能力更强。

科研能力是这次发布的重头戏。Anthropic让Mythos 5.1接入开源蛋白质设计工具,自行设计binder,再送外部机构做真实实验验证。结果在12个靶点上命中率接近50%,而常见命中率只有10%-15%;其中三个靶点上,结合亲和力比Adaptyv Bio比赛最佳方案高出约10倍。Fable 5.1还用NASA Magellan任务的雷达数据训练神经网络,为约三分之一金星表面生成高分辨率高程地图,分辨率从10-20公里级提升到2-3公里,高度数据准确度最高提升约25%。


Mythos 5.1还针对7个开源模型编写定制GPU Kernel并缓存中间结果,在输出完全一致的情况下把推理速度最高提升2.5倍,Anthropic估算全基因组分析任务的GPU成本可降30%-60%。这类工作通常需要性能工程师团队几周,而Mythos 5.1只用了几天。这些优化计划开源。

Claude正在进入更长的科研流程。发布前一周,Anthropic开放了Model Hardware Standard(MHS)研究预览,希望让AI Agent直接操作显微镜、液体处理设备和机械臂等实验室硬件。

安全问题也在同步升级。Fable 5.1加入了更强的反蒸馏机制:过去API用户可修改多轮对话历史并保留Claude的thinking记录,外部模型因此有机会批量收集推理轨迹。从发布当天起,新创建的API账号修改历史上下文后,已保存的thinking transcript不能继续保留。Anthropic明确这是为了封堵“已经公开记录的蒸馏技术”。企业端则推出Enterprise Frontier Safeguards(EFS),把监控数据存在客户自己的云基础设施里,人工审查也默认由客户完成,已与超过100家金融、医疗、制造等客户共同开发,秋季起分阶段上线。

接下来是IPO。The Information报道,Anthropic计划在9月7日劳动节后公开招股书,9月中旬投资者日,最快9月底至10月初上市。5月私募估值达9650亿美元,《金融时报》采访的投资者预计上市估值可能超2万亿美元,年化收入年底或达1000亿-1200亿美元,甚至有投资者按30倍收入倍数算出3万亿。路透社获得的内部预测显示,2028年收入预计1900亿-2000亿美元;年化收入run rate已从2025年底的约90亿美元增至7月底的650亿美元以上,二季度初步收入超115亿美元,是去年同期的14倍,首次录得正的调整后营业利润。 我们在之前的文章里对此有过更为详细的讨论。

上市前夕,Anthropic仍在巨额投入。Fable 5.1发布前一周,被曝与Nscale签下六年450亿美元算力合同,租用西弗吉尼亚约460MW数据中心容量;几天后又与英伟达支持的Lambda签下约350亿美元云计算合同,对应得州约350MW数据中心。仅这两笔算力承诺就达800亿美元(约5377亿元人民币)。

这也让Fable 5.1的变化有了另一层意义:一方面继续证明Claude处在前沿;另一方面,只证明“模型更聪明”已经不够。蛋白质设计、科研计算、企业Agent、网络安全和EFS都在把Claude推向企业愿意花大钱解决的问题。降低缓存读取价格同样如此——Anthropic没有参加基础Token低价竞争,而是针对长时间Agent把典型成本降低约25%,高度Agent化任务最高降低约45%。模型更强,Agent可以工作得更久;工作更久,又必须把单位算力成本压下来。这正是Anthropic上市后最需要证明的算术题:增长已经够快,但在算力承诺以数百亿美元速度膨胀时,收入能不能跑赢成本?从更长时间Agent,到科研和企业任务,再到降价、安全、权限和基础设施,Anthropic正在证明一条链路:模型能力变成工作,工作变成收入,收入最终跑赢算力。几天后公开招股书,这条链路就会变成华尔街给Anthropic定价的依据。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断