OpenRouter被Stripe以70亿美元收购,其Token调用量榜单被国内业界奉为圭臬。但深入剖析可见,这类榜单仅占全球2%流量且充斥价格补贴与匿名刷榜,连同评测机构频繁调权,大模型行业的评测信用正面临集体挤兑。
大模型时代最昂贵的资产是排名。国内科技圈判断自家模型成色最快的方式,往往是看它在几张美国公司的榜单上排第几。然而,这几张被奉为行业灯塔的榜单,背后却充斥着商业算盘、价格战补贴与失真的评估标准。
OpenRouter做的是大模型API聚合生意:把各家大模型的API挂在统一货架上,开发者过一道手中转。它不赚Token差价,靠收取充值手续费(信用卡渠道抽成5.5%)盈利。本质上,它是一家私人API聚合商,靠抽取“过路费”为生。
2026年8月,支付巨头Stripe以超70亿美元敲定对OpenRouter的收购。这家聚合柜台由此并入支付基础设施,但它发布的“调用量榜单”却被国内媒体冠以“全球开发者用Token投票”的光环。
事实上,OpenRouter的调用量根本代表不了市场总量:
把一个边缘聚合渠道的流水当成全行业的公投,无异于拿单个批发市场的出货单来做全国经济普查。
在OpenRouter的周榜上,中国模型曾多次登顶。但推动调用量冲顶的核心动力往往不是模型综合能力,而是极致的性价比与短期促销。
例如,DeepSeek V4.1 Flash的闲时输入价仅为每百万Token 0.15美元,与部分海外旗舰模型相差数十倍。当开发者运行复杂的AI智能体(Agent)工作流时,极低的单价直接决定了调用规模。此外,该平台的周榜采用滚动7天窗口计算,每日数据的微小变动就会让排名大幅震荡,“周冠军”实际上成了“月度价格战冠军”。
更值得关注的是“匿名公测”已成为标准营销流水线:
从智谱GLM系列的代号到引发热议的Space Bunny,这种“免费公测场+首发广告牌”的打法已被反复验证。榜单记录的不是纯粹的技术口碑,而是补贴力度与羊毛厚度的乘积。
如果说OpenRouter代表“流水榜”,那么Artificial Analysis等机构则构成了“考场榜”。但这些综合基准的考卷构成与评分标准同样存在结构性偏差。
以其核心评测项目GDPval为例,该项目由OpenAI主导设计,基于美国劳工统计局职业库,主要测试咨询备忘录、专业图表等美国白领交付物。这在美国高时薪环境下具备极高的替代价值,但与国内企业聚焦于即时沟通、审批流与报表处理的实际痛点严重脱节。
与此同时,评测机构自身的标准频繁调整。数月内,评测科目被多次替换、权重反复重调、评分锚点重新拟合。这意味着跨版本间的历史得分失去可比性,而出题方与裁判席往往直接由头部厂商或其模型衍生工具充当。
即使是强调“防止刷题、考察推理规律”的纯智商测试(如ARC-AGI系列),其权威性也在快速衰减。
ARC-AGI-2曾坚守一年,但随后被新一代模型本体迅速攻破;ARC-AGI-3上线仅数月,分数便在特定接口下被大幅刷新。更关键的是,评测机构开辟了区分标准接口与厂商私有接口(允许保留专有推理状态)的双重口径,导致不同架构模型的分数难以在同一维度对比。一旦题目被攻破并被迫换代,所有旧分数与旧排名随即变成“历史文物”。
面对正在贬值的榜单信用,业界在评估模型时更需保持理性:
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断