前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 大模型/10.07 · 12:35/5 MIN/编译自 穷奇观察/1 阅读

大模型榜单信仰破灭:OpenRouter流水与评测失真真相

OpenRouter被Stripe以70亿美元收购,其Token调用量榜单被国内业界奉为圭臬。但深入剖析可见,这类榜单仅占全球2%流量且充斥价格补贴与匿名刷榜,连同评测机构频繁调权,大模型行业的评测信用正面临集体挤兑。

大模型时代最昂贵的资产是排名。国内科技圈判断自家模型成色最快的方式,往往是看它在几张美国公司的榜单上排第几。然而,这几张被奉为行业灯塔的榜单,背后却充斥着商业算盘、价格战补贴与失真的评估标准。

流水单成不了行业灯塔

OpenRouter做的是大模型API聚合生意:把各家大模型的API挂在统一货架上,开发者过一道手中转。它不赚Token差价,靠收取充值手续费(信用卡渠道抽成5.5%)盈利。本质上,它是一家私人API聚合商,靠抽取“过路费”为生。

2026年8月,支付巨头Stripe以超70亿美元敲定对OpenRouter的收购。这家聚合柜台由此并入支付基础设施,但它发布的“调用量榜单”却被国内媒体冠以“全球开发者用Token投票”的光环。

事实上,OpenRouter的调用量根本代表不了市场总量:

  • 市场份额极小:中国信通院数据显示,OpenRouter每周的Token调用量仅占全球总量的2%左右。OpenAI、Anthropic官方直销接口以及微软Azure、亚马逊Bedrock等云巨头流量完全不在其中。
  • 用户构成局限:平台用户中美国占47.17%,中国仅占6.01%;语言分布上,英语占比高达82.87%,中文不足5%。

把一个边缘聚合渠道的流水当成全行业的公投,无异于拿单个批发市场的出货单来做全国经济普查。

价格战与“刷榜流水线”

在OpenRouter的周榜上,中国模型曾多次登顶。但推动调用量冲顶的核心动力往往不是模型综合能力,而是极致的性价比与短期促销。

例如,DeepSeek V4.1 Flash的闲时输入价仅为每百万Token 0.15美元,与部分海外旗舰模型相差数十倍。当开发者运行复杂的AI智能体(Agent)工作流时,极低的单价直接决定了调用规模。此外,该平台的周榜采用滚动7天窗口计算,每日数据的微小变动就会让排名大幅震荡,“周冠军”实际上成了“月度价格战冠军”。

更值得关注的是“匿名公测”已成为标准营销流水线:

  1. 匿名上线:厂商以代号(如Pony Alpha、Space Bunny)匿名免费挂网,不限流量。
  2. 冲榜刷量:开发者与测试脚本利用免费额度大量调用,模型迅速登上周榜前列。
  3. 官宣收钱:截取登顶战报后,厂商宣布正式身份并开启商业化接口,同时关闭海外免费通道。

从智谱GLM系列的代号到引发热议的Space Bunny,这种“免费公测场+首发广告牌”的打法已被反复验证。榜单记录的不是纯粹的技术口碑,而是补贴力度与羊毛厚度的乘积。

考纲偏科与动态刻度

如果说OpenRouter代表“流水榜”,那么Artificial Analysis等机构则构成了“考场榜”。但这些综合基准的考卷构成与评分标准同样存在结构性偏差。

以其核心评测项目GDPval为例,该项目由OpenAI主导设计,基于美国劳工统计局职业库,主要测试咨询备忘录、专业图表等美国白领交付物。这在美国高时薪环境下具备极高的替代价值,但与国内企业聚焦于即时沟通、审批流与报表处理的实际痛点严重脱节。

与此同时,评测机构自身的标准频繁调整。数月内,评测科目被多次替换、权重反复重调、评分锚点重新拟合。这意味着跨版本间的历史得分失去可比性,而出题方与裁判席往往直接由头部厂商或其模型衍生工具充当。

基准测试的快速折旧

即使是强调“防止刷题、考察推理规律”的纯智商测试(如ARC-AGI系列),其权威性也在快速衰减。

ARC-AGI-2曾坚守一年,但随后被新一代模型本体迅速攻破;ARC-AGI-3上线仅数月,分数便在特定接口下被大幅刷新。更关键的是,评测机构开辟了区分标准接口与厂商私有接口(允许保留专有推理状态)的双重口径,导致不同架构模型的分数难以在同一维度对比。一旦题目被攻破并被迫换代,所有旧分数与旧排名随即变成“历史文物”。

面对正在贬值的榜单信用,业界在评估模型时更需保持理性:

  • 看长期趋势,不看单周名次:名次只是短期快照,连续数周的稳定性更有参考价值;
  • 核对评测版本与更新日志:任何脱离具体评测版本号的分数对比都缺乏意义;
  • 关注单位任务成本:综合考虑实际业务场景下的单Token成本与推理效果,而非盲目追逐总分第一。
标签:OpenRouter大语言模型DeepSeektoken

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

Triton 为什么跑赢 CUDA:Meta 重写推荐系统嵌入算子的关键一步
置顶

Triton 为什么跑赢 CUDA:Meta 重写推荐系统嵌入算子的关键一步

新硬件接入 PyTorch:从补丁地狱到标准化工作流
置顶

新硬件接入 PyTorch:从补丁地狱到标准化工作流

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
置顶

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

//

24小时热榜

Google发布EmbeddingGemma 2开源多模态嵌入模型
TOP1

Google发布EmbeddingGemma 2开源多模态嵌入模型

DeepSeek曝新一轮融资近千亿,月之暗面拟赴港IPO
TOP2

DeepSeek曝新一轮融资近千亿,月之暗面拟赴港IPO

3

Mistral发布万亿参数大模型ML4,开源权重月底上线

11小时前
Mistral发布万亿参数大模型ML4,开源权重月底上线
4

OpenAI开源未发布大模型生成的722篇数学论文

7小时前
OpenAI开源未发布大模型生成的722篇数学论文
5

谷歌发布 Nano Banana 2.1:图像生成价格减半

7小时前
谷歌发布 Nano Banana 2.1:图像生成价格减半
6

DeepSeek被曝将完成超800亿元新融资

11小时前
DeepSeek被曝将完成超800亿元新融资
7

Anthropic升级网络安全验证计划,开放高级AI防御权限

11小时前
Anthropic升级网络安全验证计划,开放高级AI防御权限
8

为什么每个APP都想借钱给你?揭秘互联网流量变现的尽头

3小时前
为什么每个APP都想借钱给你?揭秘互联网流量变现的尽头
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断