前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
洞察/09.14 · 00:00/5 MIN/编译自 光锥智能/0 阅读

大模型Token价格三个月腰斩,大厂掀起Flash降价潮

8月全球大语言模型平均Token支出价格首次跌破1美元,较5月腰斩。在企业预算收紧与Agent调用激增的双重驱动下,各厂商纷纷压低缓存成本并力推低价Flash模型,大模型行业正从堆智力走向极致性价比竞争。

近期,全球大模型赛道迎来密集的产品迭代期。从海外的 OpenAI、Anthropic、Google,到国内头部厂商,新模型发布节奏不断加快。

然而,与模型能力节节攀升形成强烈反差的,是其调用价格的断崖式下滑。根据 Silicon Data 的大语言模型 Token 支出指数,8 月全球市场每百万 Token 的平均支付价格单月暴跌 29%,降至 0.97 美元,历史上首次跌破 1 美元关口。相比今年 5 月超过 2 美元的高点,Token 单价在短短三个月内直接腰斩。

LLM Token支出指数走势

平均调用成本的暴跌主要由两股力量推动:全行业主动调价,以及调用流量向廉价模型集中。大模型行业正在呈现“模型能力通胀,Token 价格通缩”的全新态势。

Flash 系列井喷,性价比取代刷榜

过去,大模型厂商习惯通过打榜和刷基准测试来展现智力水平。如今,行业讨论的风向发生了根本性逆转:在能力够用的前提下,价格究竟能压到多低?

以 OpenAI 为例,降价动作已从轻量模型蔓延至旗舰系列。7 月底,OpenAI 宣布 GPT-5.6 Luna 永久降价 80%;随后不到一个月,旗舰模型 GPT-5.6 Sol 的输入与输出价格也分别下调 20% 和三分之一。

OpenAI模型降价调整

除了直接打折,各大厂商更为核心的动作是推出各类轻量高效的“Flash”模型,使其成为企业日常调用的主力。智谱的 GLM-5.3-Flash、阿里的 Qwen3.8-Flash、月之暗面的 Kimi K2.8 Preview 以及 DeepSeek V4.1 Flash 均在这一阶段密集上线。

国内Flash系列模型发布概况

这些 Flash 模型的定位非常务实:不做面面俱到的优等生,而是充当物美价廉的“通用打工人”。通过架构改良大幅降低训练与推理成本,以旗舰模型的零头价格提供“够用”的日常生产力。

缓存成本大砍,精准补贴 AI 智能体

在模型本身降价之外,旗舰模型的成本结构优化也成了竞争焦点,最突出的手段是对上下文缓存(KV Cache)费用进行“大放水”。

Anthropic 发布的 Claude Fable 5.1 虽然基础定价依然不低,但其缓存读取价格直接从 1 美元/百万 Token 降至 0.25 美元,降幅达 75%。DeepSeek 同样通过重构注意力机制和压缩缓存精度,显著降低了显存占用成本。

DeepSeek优化KV缓存架构

在大模型推理中,预填充(Prefill)需要计算海量上下文注意力,耗费算力最大;而二次调用命中缓存后,读取成本近乎为零。当下快速爆发的 AI 智能体(Agent)通常涉及长上下文的高频往复读取,降低缓存资费,本质上就是厂商在精准补贴高频业务场景。

企业账单承压,供给侧迎来后训练红利

大模型厂商主动下调定价,首要原因在于需求端已经“吃不消”。

以 Uber 为例,其 CTO 曾透露,部分工程师单月 API 调用支出高达 500 至 2000 美元,导致全年 AI 预算提前耗尽。Meta、Amazon 等企业也纷纷对 Cursor、Claude Code 等编程助手的调用额度设立上限,防止 Token 支出失控。

企业AI工具成本管理现状

当高昂账单未能直接转化为业务产出时,企业开始大规模转向开源或低价模型。对于依赖调用量支撑估值的闭源大模型厂商而言,降价挽留客户成了必然选择。

同时,技术演进为降价提供了底层底气。虽然超大规模预训练依然耗资巨大,但行业正逐步转向依靠后训练(Post-training)提升能力上限。通过强化学习、长程任务反馈和提升推理效率,厂商可以用更小的模型体量实现更优性能,大幅改写了单位算力的成本曲线。

大模型训练集群硬件投入

“薄利多销”面临阵痛,增长仍待场景泛化

长久以来,AI 领域信奉“杰文斯悖论”:模型单价越低,调用需求就会呈现爆发式增长,从而带动整体营收扩张。

但近期的市场数据却显示出短期背离。摩根大通针对 OpenRouter 平台的统计表明,8 月路由的 Token 总量环比上涨约 47%,但平台的实际美元支出仅微增 7%。在用量排名前十的模型中,低价 Flash 系列占据半壁江山,新增流量几乎全被低价模型吸收。

OpenRouter调用量与支出变化

这表明,当前产业处于“降价速度快于新场景释放速度”的过渡阶段。随着模型逐步融入复杂工作流与具身智能等前沿领域,通用智能长出操纵专业软件甚至物理硬件的“手脚”,新的大规模需求才会真正被激活。

在大模型能力梯队不断收窄的背景下,定价权已从纯粹的“算法领先”滑向“工程化与极致性价比”。当高品质 Token 真正变成价格低廉的基础设施时,AI 规模化应用的下半场才算真正开局。

标签:OpenAIDeepSeek大语言模型token

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄
置顶

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案
置顶

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案

//

24小时热榜

Anthropic CEO呼吁放缓AI研发,中方批其套用“冷战剧本”
TOP1

Anthropic CEO呼吁放缓AI研发,中方批其套用“冷战剧本”

Anthropic:应通过立法强制推行AI“紧急开关”
TOP2

Anthropic:应通过立法强制推行AI“紧急开关”

3

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄

4小时前
混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄
4

MIT用GPT-5.6 Sol实现量子芯片自动校准

7小时前
MIT用GPT-5.6 Sol实现量子芯片自动校准
5

OpenAI发布Agents API:一次调用搞定云端智能体

7小时前
OpenAI发布Agents API:一次调用搞定云端智能体
6

Anthropic CEO发文预警:失控的AI智能体或在一年内接管网络

14小时前
Anthropic CEO发文预警:失控的AI智能体或在一年内接管网络
7

百家号变身直播伴侣:百度在AI与短视频夹击下重构内容版图

14小时前
百家号变身直播伴侣:百度在AI与短视频夹击下重构内容版图
8

科技早报:Claude Opus 5.2灰度上线,iOS 27与新Siri正式发布

14小时前
科技早报:Claude Opus 5.2灰度上线,iOS 27与新Siri正式发布
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断