雷峰网实测 GLM 5.3 与 GLM 5.2 开发同一款北京国贸至望京 3D 驾驶游戏。结果发现,5.3 完成更快、真实感更强,但在自动化工具链中因安全拒绝频繁卡顿,暴露出“能力变强但更难驾驭”的新问题。
GLM 5.3 是智谱 2026 年 8 月 13 日发布的最新旗舰模型。它沿用 GLM 5.2 的底座,主要通过更大规模、更贴近真实工程场景的后训练提升复杂编程与长程任务能力。官方特别强调其网络安全能力大幅增强,但社区也出现“过度防御”“文案全是黑话”的声音。为了验证模型迭代的真实效果,雷峰网让 GLM 5.3 与 GLM 5.2 完成同一道开发题:从零构建一款基于 OpenStreetMap 真实数据的“北京国贸—望京”3D 开放世界驾驶游戏。

测试要求游戏在浏览器单机运行、不依赖任何在线服务,还需覆盖数据勘查、车辆物理、昼夜循环、早高峰车流翻倍、地图边缘软性阻挡、导航、音效、存档、离线打包和 README 交付。测试在智谱 ZCode 开发环境中进行,让两个模型在相同提示词下自动完成。
最终两个模型都端到端完成了项目。GLM 5.3 用时 50 分 47 秒,比 GLM 5.2 的 66 分 1 秒快了约 15 分钟;代码规模接近(3,104 行 vs 3,063 行),但文件组织更集中(14 个 vs 20 个)。技术选型上,5.3 采用 three.js ES Module 与实时阴影,画面更现代;5.2 采用 UMD 零构建方案,兼容性更强,甚至直接打开文件也能离线运行。


从实际体验看,GLM 5.3 加入了路灯、光影、路标和 HUD 提示,速度反馈更接近真实驾驶,超车和变道时能获得更自然的操作感。GLM 5.2 虽然功能完整,但存在左右键接反、车头朝向公式错误等问题,最高速度仅约 45km/h,超车时常常动力不足而撞车。整体上,5.3 更像产品原型,5.2 更像验证型版本。

这种真实感差异与模型训练方式直接相关。GLM 5.3 使用与 5.2 相同的基础模型,能力提升来自后训练中的复杂工程环境强化。官方榜单显示,GLM 5.3 在 Terminal Bench 3.0 上从 4.6 提升到 28.3,在 DeepSWE v1.1 上从 46.2 提升到 66.9,在 SWE-Marathon v1.1 上从 19.4 提升到 42.5。这些基准衡量的核心正是长程任务中的工具操作、代码阅读和工程交付能力。

不过,测试中最耗时的坑并不在代码生成,而在安全策略与工具链的衔接。最初测试团队让两个模型同时在 Claude Code 自动化环境中运行,一个多小时后 GLM 5.2 已经完成项目,GLM 5.3 却还停在数据校验判断的报错上。原因是 Claude Code 会让模型判断当前操作是否可以继续,而 GLM 5.3 在判断节点触发了更严格的安全拒绝,导致流程卡死。

官方数据显示,GLM 5.3 在 CyberGym 得分为 84.5,高于 5.2 的 77.2;在 ExploitBench 上从 24.4 跃升至 54.4。安全能力增强意味着模型能识别更复杂的漏洞利用链,也会在自动化执行、权限判断等场景中更加谨慎。这解释了为什么 GLM 5.3 在复杂编程任务上更强,却在 Claude Code 的自动化流程中一度无法推进。

总结来看,GLM 5.3 通过后训练把能力推向“产品开发者”方向,能更好地将复杂需求整合为可体验的原型;GLM 5.2 则像稳定的工程执行基线。但更强的安全能力也带来新的问题:模型的谨慎可能让正常开发流程被意外卡住。当模型从代码生成器进化为更强的 Agent 后端,评估标准不应只看最终交付,还要看它能否与现有工具链顺畅协作。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断