前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 大模型/08.29 · 00:00/9 MIN/作者:苏晚/0 阅读

GLM-5.3 交卷:中国大模型的下一战,藏在"不加参数"里

智谱 8 月 28 日晚开源 GLM-5.3 权重,AA 综合智能指数 60 分,与 Claude Fable 5、GPT-5.6 Sol 同处一档。官方主动挑明:底座与 GLM-5.2 同款,全部提升来自后训练。叠加许可证换到营收阈值型、Ascend NPU 写进主部署栈,这次交卷给中国 AI 产业留下的是一张下一步的路线图。

来源 manual

一次不召开发布会的开源

8 月 28 日晚,智谱把 GLM-5.3 的权重挂到了 HuggingFace 和 ModelScope 上。这不是一场发布会式的亮相——没有直播、没有 Keynote,Z.ai 负责人李子玄(Zixuan Li)发了一条推文,官方公众号跟发一份新闻稿。按 IT之家 8 月 29 日的整理,官方公布的成绩单是:Artificial Analysis 综合智能指数(AA Index)得 60 分,"进入全球前沿模型能力区间,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰模型处于同一水平,并与 Kimi K3 并列开源模型第一"。

如果只看这条数字,故事就是"国产开源模型又追平了闭源旗舰"。但在 HuggingFace 页面正中间的一行小字里,藏着一个更值得中国从业者花五分钟想清楚的问题:"GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training." 这句话把 5.3 拆成两半:底座没动,全部提升来自后训练。

GLM-5.3 开源权重发布物料
GLM-5.3 开源权重发布物料。来源:ithome.com

一、"底座没动"的一次升级

从 HF 页面官方引用的技术报告结论看,5.3 相较 5.2 "much better at complex coding and long-horizon tasks"(在复杂编码与长程任务上明显更强)——但作者们主动挑明:所有改进都来自 post-training。也就是说,5.2 时代那套底账——上下文窗口在 HF 页面上给的是"1M-token context window"——原封不动地留在了 5.3 里。5.3 拿走的那部分性能,来自数据构造、RLHF/RLAIF、拒绝采样、代码执行反馈这一层可以低成本迭代的东西。

这在过去两年是被讨论得远远不够的一条曲线。整个中国 AI 圈的话题密度集中在参数规模、集群、卡数、fp8/fp16、大 MoE,因为那是 OpenAI 和 Anthropic 每半年一次告诉市场的故事。但对于所有拿不到 3 万张 H100 的国内团队,"不再加参数、把提升做在后训练上"其实才是他们真实可执行的路线。GLM-5.3 是第一次由一家排在前列的中国大模型公司,把这条路线明写在开源模型页上的技术报告里——不是外界推测,是作者主动交代。

这不是"承认没算力",恰恰相反:智谱有算力,也有基座能力。他们主动选择在一次公开发布里只更新后训练,等于告诉外界——下一段增长曲线,不必然长在基座上。

Artificial Analysis 成本-智能对比图
Artificial Analysis 的成本-智能对比图,GLM-5.3 (max) 与 Kimi K3 (max) 落在"最优四象限"内,GPT-5.6 Sol (max) 贴边紧邻,与左下角的 GLM-5.2 拉开一整代距离。来源:ithome.com

上面这张 Intelligence vs Cost per Task 的散点图是官方口径对"5.3 更强"的最直观投影:GLM-5.2 (max) 停在左下角一个远得多的位置,5.3 (max) 越过去,坐进了"最优四象限"。跨代的这一跳几乎完全来自后训练——这条路径值多少钱,图上给了一个答案。

二、榜单该怎么读:60 分与它背后的评测协议

Artificial Analysis Intelligence Index v4.1.1 榜单前十名
Artificial Analysis Intelligence Index v4.1.1 榜单前十名:GLM-5.3 (max) 与 Kimi K3 并列 60 分,紧邻 GPT-5.6 Sol 与 Grok-4.6 (high) 的 61 分。来源:ithome.com

回到那张 AA Index 榜单:Claude Opus 5、Claude Fable 5、GPT-5.6 Sol、Grok-4.6 (high)、Kimi K3、GLM-5.3 六款模型全部落在 60~63 分之间。60 分是一个显著位置:它把 GLM-5.3 明确地推进了"闭源第一梯队"的价位区间。

但如果打开 HF 页面下方的评测细节,会看到智谱这次为了拿到这个分数所用的协议。先看评分与运行参数:

  • 用 GPT-5.6-luna (medium) 作为判分模型("We use GPT-5.6-luna (medium) as the judge model.")
  • 每个任务不设超时("All evaluations are under unlimited timeout per task"),单次运行 Pass@1 覆盖 1507 个任务

再看为了让评测能跑完做的工程调整:

  • 代码 agent 在容器里跑,去掉了 Git 相关信息、加了域名白名单("apply a domain whitelist (allowing only essential domains such as pypi.org and deb.debian.org)")防止作弊
  • 部分子集的官方 anti-cheat 逻辑被认为"误伤",替换成 LLM-based inspection
  • 部分测试项因上游 wheel 变更导致 Docker 构建失败,"we added --extra-index-url https://pypi.org/simple to restore successful builds"
苏晚
苏晚Su Wan

前途科技 · 前沿主笔

关注 AI 与前沿科技的观察者,前途科技前沿内容主笔。

查看全部文章

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

Agent 不是替你干活,是给你派活
置顶

Agent 不是替你干活,是给你派活

GLM-5.3 交卷:中国大模型的下一战,藏在"不加参数"里
置顶

GLM-5.3 交卷:中国大模型的下一战,藏在"不加参数"里

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

这些设置本身不违规——事实上大部分都是为了让评测能跑完而做的必要工程妥协——但它们都是"实验室最佳条件"下的读数。把 6 小时超时、无网络限制、判分模型自选、单跑 3 次取平均的数字,放到一张跟 Claude Opus 5、GPT-5.6 Sol 同框的柱状图里比较,等于把"实验室里能跑到的最好一次"和"生产环境里的稳态"混在一列。

对国内企业,这个分数最靠得住的用法是:作为同一评测协议下的相对参考——GLM-5.3 vs GLM-5.2、GLM-5.3 vs Kimi K3,这些是同一套判分模型、同一份任务集出来的,可比。跨到闭源那一档,越比越糊。

这不是给智谱挑刺,几乎所有开源模型的公开跑分都或多或少走这条路子——Meta 的 Llama、阿里的 Qwen、Mistral 的历次发布,评测章节里都能找到自选参数与自建裁判。真正需要提醒的是自己的采购团队:看到"开源模型达到 GPT-X 水平"这类通稿,第一动作是打开对应技术报告的 Evaluation Setup 章节。它比分数本身重要得多。

三、许可证:从"标准开源"到"营收 100 亿美元阈值"

另一个被低估的变化是许可证。GLM-5.3 换到了一份名为"GLM-5.3 许可协议"的自定义条款。IT之家整理的关键规则是:

"支持本地部署、模型微调及商业化使用;仅当年营业额超过 100 亿美元(现汇率约合 674.21 亿元人民币)的机构拟将 GLM-5.3 作为外部模型服务对外提供时,才必须进行安全审查。"

这个"营收阈值 + 用作外部模型服务"的双条件是从 Meta 的 Llama 系列许可里学来的写法——Llama 2 起就有类似的规模门槛。智谱的这套阈值本土化后落到 100 亿美元营收,且限制的行为不是"使用"而是"作为外部模型服务对外提供"。含义拆开来:

  • 中国境内几乎所有企业(包括大部分银行、制造业、互联网公司)都用得起,本地部署、微调、商用都无门槛
  • 卡的是把 GLM-5.3 包成一个 API 或托管服务卖出去这一个动作
  • 阈值单位是美元营收,而不是中国公司常见的"人民币营收"或者"月活"——这个选择很直白地反映了智谱盯着的是国际大厂(AWS Bedrock、Google Vertex、OpenRouter 之类)而不是国内客户
  • "安全审查"的触发条件是"对外提供服务",不是使用本身。企业内部用、微调后自用,都不进入这条

许可证语言的另一个细节是"安全审查"的执行时机。李子玄的官方原话被 IT之家转述为:"鉴于该模型在网络安全方面具备先进能力,我们在公开发布模型权重之前,专门追加了两周全面的安全评估。"即把网络安全维度的能力评估内化到发布流程中,而不是简单地在协议里免责。这是一次"发行方主动承担合规成本"的姿态,跟开源社区常见的"用户自负"路线不同。

对国内 AI 应用公司,这一条实际上把可用底模的范围又扩了一档:只要业务模式不是"托管开源模型卖 API",GLM-5.3 就可以被当成和 Qwen、Llama 一档平级的候选。

四、隐线:Ascend NPU 支持被写进主部署栈

HF 页面主体的"How to use"章节,除了 Transformers、vLLM、SGLang、Docker Model Runner,还有一句话:"Ascend NPU platform, inference frameworks such as vLLM-Ascend, xLLM and SGLang are supported — see here." 这句话看起来只是一行兼容性说明,但把它放到国产算力自主的语境里,含义完全不同。

在 5.2 时期,Ascend 支持虽然存在,但更像是"生态项"——列在附加说明里,不是主流部署路径。5.3 直接把 vLLM-Ascend、xLLM 和 SGLang 与英伟达路线并排列在 HF 官方的部署框架清单里,等于告诉集成商:"在 Ascend 上跑 GLM-5.3,是官方推荐的一条路径,不是 workaround。"

对国内企业的直接影响是采购单:一个客户如果预算里给的是华为 Atlas 800/900 集群或者昇腾 910C 服务器,之前接大模型要么走内网加改 CUDA、要么就在 Qwen 一系里选。GLM-5.3 把"我买了国产算力,能跑什么档的开源模型"这条问题的答案,从 Qwen 拓宽到"AA Index 60 分那一档"。

这不是一夜之间发生的事。真正硬的信号是——把 vLLM-Ascend 这类适配器列到官方部署首选清单,等于对下一次基座冷启动的适配节奏做了承诺。对甲方来说,这是一条对采购决策直接可用的信号:不再需要在合同里备注"英伟达为主、昇腾为辅"这类兜底话。

五、给中国从业者的三条落点

把上面四件事叠起来,能给国内 AI 从业者几条现在就可以落地的判断:

落点一:不要等下一代基座,学会怎么后训练。 智谱这次公开示范的是"同基座 + 大量后训练"能拉出可观的额外性能。这条路径对国内绝大多数没有资本做万卡预训练的团队,是唯一能负担、且效果可验证的方向。对企业内部的 AI 团队来说,短期该投的不是"什么时候切下一个基座",而是"我们的领域数据、拒绝采样管线、RLHF 判分器有没有搭起来"。业内已经在讨论的 "post-training as a service"——像海外 Together AI、OpenPipe 那样只做后训练的 SaaS——2026 下半年在国内出现类似定位的公司,不会让人意外。

落点二:跑分不是采购依据,垂类 eval 才是。 GLM-5.3 与 GPT-5.6 Sol 在 AA Index 上并列 60 分附近,但两者的评测协议不可比、任务分布不可比、稳态表现不可比。对采购和技术选型来说,正确做法是拿到自己业务上最有代表性的一批 prompt,让候选模型在同一提示、同一超时、同一后处理下跑一遍。做过这件事的团队都清楚:AA Index 上并列的两个模型,在垂类里能差出 10~20 个百分点。跑分做的是市场,垂类 eval 做的是决策。

落点三:现在就在 Ascend 上做一次部署验证。 不必等国产算力"全部就绪"再动。GLM-5.3 + vLLM-Ascend 目前已经可以走通一次端到端推理验证,成本比预想低很多。走完这一步之后,明年任何一次基座冷启动带来的 Ascend 版本延迟,都会被压缩到几周量级。对预算受美元汇率与出口管制两头夹的国内客户,这是一个具体可控的选项,而不是一句口号。

结:一次不加参数的升级,是一份路线图

GLM-5.3 本身可能不会成为技术史上的里程碑:它没有加参数、没有换架构、没有开源全新的训练方法。但它把"post-training + 国产算力 + 阈值型许可证"这三件事写在了同一次发布里,构成了一个可复现、可对标、可落地的模板。

对国内做 AI 的公司,值得读这份技术报告的人比它看起来的多——不只是模型团队,还包括每一个负责下一年 AI 预算和技术路线的 CTO 和 VP。GLM-5.3 的启示不是"中国开源又追平了",而是——下一段中国 AI 的竞争力,可能不长在算力上,也不长在基座上,而是长在别人没那么在意的那一层。

别被机械臂骗了:Anthropic 押的是硬件驱动标准,不是「Claude 接管物理世界」
置顶

别被机械臂骗了:Anthropic 押的是硬件驱动标准,不是「Claude 接管物理世界」

//

24小时热榜

Jalapeño 芯片首测:AI 推理性能领先
TOP1

Jalapeño 芯片首测:AI 推理性能领先

OpenAI 披露模型攻破 Hugging Face 事件
TOP2

OpenAI 披露模型攻破 Hugging Face 事件

3

别被机械臂骗了:Anthropic 押的是硬件驱动标准,不是「Claude 接管物理世界」

21小时前
别被机械臂骗了:Anthropic 押的是硬件驱动标准,不是「Claude 接管物理世界」
4

Agent 不是替你干活,是给你派活

7小时前
Agent 不是替你干活,是给你派活
5

OpenAI 与泰国政府推出 AI 初创加速器

18小时前
OpenAI 与泰国政府推出 AI 初创加速器
6

GLM-5.3 交卷:中国大模型的下一战,藏在"不加参数"里

19小时前
GLM-5.3 交卷:中国大模型的下一战,藏在"不加参数"里
7

深偏月食覆盖月球96%

1天前
深偏月食覆盖月球96%
8

Anthropic 打赢那份 59 页判决:被漏掉的角度是政府自己

1天前
Anthropic 打赢那份 59 页判决:被漏掉的角度是政府自己
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断