阿里发布 Qwen 3.8-Max 后,作者用 3D 大模型演进宇宙网站实测其长程 Agent 能力,并与 GPT-5.6 同题迭代对比:Qwen 用时 3 小时 29 分,完成度更高但额度耗尽中断;GPT 仅 37 分钟交付。两者对「完成」的取舍,反映国产旗舰模型在 Agent 赛道上的新思路。

8月3日,阿里正式发布 Qwen 3.8-Max。2.4万亿总参数、约950亿激活参数、100万Token上下文,覆盖文本、代码和视觉任务,并开放Max权重和27B小模型。榜单、规模、价格、开源,延续了Qwen的惯常打法。但这一代真正不同的,是官方把大量篇幅留给了“长程Agent”:16天自主开发、125小时科研复现、数百轮芯片优化,核心都在讲模型能否在真实环境中调用工具、接收反馈、检查结果并继续修改,把复杂任务推向完成。

官方技术报告显示,Qwen 3.8-Max 基于 Qwen 3.5 架构构建,Agent能力的提升主要来自真实环境强化学习(RL)。模型不是做更多题,而是进入接近实际工作的环境:读取项目、调用工具、执行代码、观察页面、接收测试结果,再根据反馈继续修改。训练目标是一条完整闭环——规划、行动、检查、发现、再决策。官方数据显示,RL训练环境从0增加到约4000个时,综合分数从0.474提升到0.725。

为支撑这套训练,Qwen 公开了三项工程机制:环境解耦(任务、工作空间和 Agent Harness 独立扩展)、统一奖励系统(代码、文本、视觉、Agent 行为纳入同一评价机制)、在线数据均衡(动态配平不同任务和环境的训练数据)。




为了验证长程能力,作者通过 Qwen Code 把模型接入真实本地开发环境,要求用 React、Vite 和 Three.js 从零构建可交互的 3D 宇宙网站:公司是星系,历代大模型是轨道上的星球,支持旋转缩放、点击查看档案、时间轴筛选和搜索,并明确禁止用静态图片或 CSS 伪 3D 冒充。
最终项目搭出了真正的 WebGL 场景。OpenAI、Anthropic、Google、Alibaba Qwen、DeepSeek、Moonshot AI/Kimi 六个星系,28 个模型分布在轨道上;切换 2022—2026 时间轴时,模型数量和档案面板会同步变化,说明模型理解了状态依赖,而非简单拼接组件。


但视觉效果仍有短板:球体在部分角度低模感明显,偶尔有白色小方块悬浮,UI 标签密集遮挡,镜头控制粗糙;构建后的 JavaScript 接近 1MB,自动验收脚本也存在硬编码。
第二轮,作者分别在 Qwen Code 和 ChatGPT 桌面版 Codex 中调用 Qwen 3.8-Max 与 GPT-5.6,让它们基于同一份代码继续开发:优化 3D 视觉与氛围、补全 2026 年最新模型数据、增加“返回全景”、搜索飞行高亮、深度档案等产品级功能。
GPT-5.6:37分钟完成任务
Codex 运行约 37 分钟,额度消耗约 6%。它快速识别项目结构,完成了材质、交互、时间轴和比较功能,也写了本地验证脚本,项目可以正常构建。但打开页面后发现,它更像一个结构完整的 3D 数据面板,缺乏深空、科幻与浪漫氛围;2026 年最新数据没有完整补上,占位内容也未清理。它以最快速度交付了“能跑”的 MVP,但对视觉和数据完整性的验收标准比较宽松。

Qwen 3.8-Max:3小时29分钟,更高完成度
Qwen Code 累计运行 3 小时 29 分钟,发起 195 次模型请求,处理约 1664 万输入 Token 和 21.6 万输出 Token,缓存率 88.6%。页面完成度明显更高:球体体积、纹理和空间层次加强,公司与普通节点的区分更清楚,搜索与聚焦也更像“宇宙导航”入口;它还尝试联网补充 2026 年信息,清理了示例内容。但任务最终因 Token Plan 滚动额度耗尽而中断,后台返回 429 insufficient_quota。中断时上下文窗口只用了 21.86 万 Token(21.9%),限制来自持续工具调用、多轮验证和反复修改,而不是上下文容量。

免费获取企业 AI 成熟度诊断报告,发现转型机会

这次对比中,Qwen 3.8-Max 的页面完成度高于 GPT-5.6,代价是数倍时间和 Token。GPT 接受“可用”,Qwen 追求“更接近产品要求”。独立开发者 Thomas Wiegold 用四项固定任务测试 Qwen 3.8-Max 时也发现,它在每项任务中都是耗时最长的模型:扑克模拟核心功能约 20 分钟完成,模型又花近一小时调整角色行为,最终评价是“质量很高,但速度很慢”。
社区的“过度思考”包括两类消耗:一类发生在推理阶段,模型投入过多 Token 分析;另一类发生在 Agent 执行阶段,系统反复读文件、调工具、跑测试。本轮只能确认执行阶段消耗明显,无法完全归因于基座模型,Qwen Code 的策略也有影响。更高完成度依赖更深的执行循环,但每一轮后续修改的边际收益正在递减。
这也揭示了另一种选择:工程界高质量收敛往往比高速度更贵。GPT-5.6 代表效率优先,把精修留给人类;Qwen 3.8-Max 代表结果导向,不达目的不罢休。阿里官方提到,Qwen 可以完全自主运行 16 天完成复杂项目;这次 3.5 小时的测试,为这种长程自我修正能力提供了侧面证据。在高预算、高复杂度场景,比如大规模代码重构、芯片级底层优化,“不计代价”的闭环迭代或许正是跨越 AGI 落地鸿沟的有效路径。
两轮测试之后,Qwen 3.8-Max 的轮廓很清楚:长程任务能力强,愿意投入更多计算把项目推向更高完成度;代价是更长的运行时间、更多工具调用和更高 Token 消耗。但旗舰模型很难单独承担扩大采用和进入工作流的任务,阿里的打法是分工:Max 负责前沿能力,小模型扩大开发者采用,Qwen Code 和千问办公承接具体任务,阿里云负责 API、部署和企业交付。
8月3日,千问办公与 Qwen 3.8-Max 同步开放,信号已经很明确:阿里希望 Max 进入代码、文档、表格、网页和企业知识库,处理真实工作,而不只停留在聊天框和排行榜。对个人用户,多运行几小时只是等待;进入企业工作流,反复读取项目、持续调用工具、迟迟无法结束任务,都会转化为 Token 费用、交付延迟和人工验收成本。长程 Agent 不仅要有能力持续推进,还要在可控预算内完成验收,并判断何时达到交付标准。
阿里的目标不是一款更强的模型,而是把 Qwen 变成覆盖开发、办公和企业服务的 Agent 能力底座。Max 能否产生规模化价值,最终取决于这套能力能否通过模型之外的执行系统,以更稳定的方式进入真实业务。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断