8月全球大语言模型平均Token支出价格首次跌破1美元,较5月腰斩。在企业预算收紧与Agent调用激增的双重驱动下,各厂商纷纷压低缓存成本并力推低价Flash模型,大模型行业正从堆智力走向极致性价比竞争。
近期,全球大模型赛道迎来密集的产品迭代期。从海外的 OpenAI、Anthropic、Google,到国内头部厂商,新模型发布节奏不断加快。
然而,与模型能力节节攀升形成强烈反差的,是其调用价格的断崖式下滑。根据 Silicon Data 的大语言模型 Token 支出指数,8 月全球市场每百万 Token 的平均支付价格单月暴跌 29%,降至 0.97 美元,历史上首次跌破 1 美元关口。相比今年 5 月超过 2 美元的高点,Token 单价在短短三个月内直接腰斩。

平均调用成本的暴跌主要由两股力量推动:全行业主动调价,以及调用流量向廉价模型集中。大模型行业正在呈现“模型能力通胀,Token 价格通缩”的全新态势。
过去,大模型厂商习惯通过打榜和刷基准测试来展现智力水平。如今,行业讨论的风向发生了根本性逆转:在能力够用的前提下,价格究竟能压到多低?
以 OpenAI 为例,降价动作已从轻量模型蔓延至旗舰系列。7 月底,OpenAI 宣布 GPT-5.6 Luna 永久降价 80%;随后不到一个月,旗舰模型 GPT-5.6 Sol 的输入与输出价格也分别下调 20% 和三分之一。

除了直接打折,各大厂商更为核心的动作是推出各类轻量高效的“Flash”模型,使其成为企业日常调用的主力。智谱的 GLM-5.3-Flash、阿里的 Qwen3.8-Flash、月之暗面的 Kimi K2.8 Preview 以及 DeepSeek V4.1 Flash 均在这一阶段密集上线。

这些 Flash 模型的定位非常务实:不做面面俱到的优等生,而是充当物美价廉的“通用打工人”。通过架构改良大幅降低训练与推理成本,以旗舰模型的零头价格提供“够用”的日常生产力。
在模型本身降价之外,旗舰模型的成本结构优化也成了竞争焦点,最突出的手段是对上下文缓存(KV Cache)费用进行“大放水”。
Anthropic 发布的 Claude Fable 5.1 虽然基础定价依然不低,但其缓存读取价格直接从 1 美元/百万 Token 降至 0.25 美元,降幅达 75%。DeepSeek 同样通过重构注意力机制和压缩缓存精度,显著降低了显存占用成本。

在大模型推理中,预填充(Prefill)需要计算海量上下文注意力,耗费算力最大;而二次调用命中缓存后,读取成本近乎为零。当下快速爆发的 AI 智能体(Agent)通常涉及长上下文的高频往复读取,降低缓存资费,本质上就是厂商在精准补贴高频业务场景。
大模型厂商主动下调定价,首要原因在于需求端已经“吃不消”。
以 Uber 为例,其 CTO 曾透露,部分工程师单月 API 调用支出高达 500 至 2000 美元,导致全年 AI 预算提前耗尽。Meta、Amazon 等企业也纷纷对 Cursor、Claude Code 等编程助手的调用额度设立上限,防止 Token 支出失控。

当高昂账单未能直接转化为业务产出时,企业开始大规模转向开源或低价模型。对于依赖调用量支撑估值的闭源大模型厂商而言,降价挽留客户成了必然选择。
同时,技术演进为降价提供了底层底气。虽然超大规模预训练依然耗资巨大,但行业正逐步转向依靠后训练(Post-training)提升能力上限。通过强化学习、长程任务反馈和提升推理效率,厂商可以用更小的模型体量实现更优性能,大幅改写了单位算力的成本曲线。

长久以来,AI 领域信奉“杰文斯悖论”:模型单价越低,调用需求就会呈现爆发式增长,从而带动整体营收扩张。
但近期的市场数据却显示出短期背离。摩根大通针对 OpenRouter 平台的统计表明,8 月路由的 Token 总量环比上涨约 47%,但平台的实际美元支出仅微增 7%。在用量排名前十的模型中,低价 Flash 系列占据半壁江山,新增流量几乎全被低价模型吸收。

这表明,当前产业处于“降价速度快于新场景释放速度”的过渡阶段。随着模型逐步融入复杂工作流与具身智能等前沿领域,通用智能长出操纵专业软件甚至物理硬件的“手脚”,新的大规模需求才会真正被激活。
在大模型能力梯队不断收窄的背景下,定价权已从纯粹的“算法领先”滑向“工程化与极致性价比”。当高品质 Token 真正变成价格低廉的基础设施时,AI 规模化应用的下半场才算真正开局。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断