前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 大模型/08.30 · 08:00/12 MIN/作者:苏晚/0 阅读

腾讯 Hy4 preview:一个能做完项目却不会自己验收的 Agent

770B 总参、49B 激活、1M 上下文、缓存 0.042 美元/百万 tokens——参数和价格之外,Hy4 preview 更值得看的是它在 InfoQ 三次实测里露出的同一个短板:能把复杂任务做完,却不会回头验收自己交付的东西是不是真能被别人打开。这是 Agent 时代的「最后一公里」,也是这次腾讯把模型直接命名为 preview 的另一层意思。

来源 manual

8 月 28 日,腾讯把混元的下一代旗舰模型摆到了 Hugging Face 上:770B 总参、49B 激活参数、1M+ 上下文,官方名字叫 Tencent Hy4 preview。产品线是 WorkBuddy / CodeBuddy / 元宝 / ima 全线首发,API 走腾讯云 TokenHub 与 OpenRouter,两周内 WorkBuddy 和 CodeBuddy 面向用户免费开放,Hy3 的免费窗口也顺势延长到 9 月 30 日(来源:腾讯官网、IT之家)。定价上,官方英文页给出的是 USD 0.834 / 百万输入、USD 2.501 / 百万输出、USD 0.042 / 百万缓存命中,人民币标价则是 6 元 / 18 元 / 0.3 元(来源:InfoQ)。

把这些数字排开来看,Hy4 preview 是一款「值得试」的模型——腾讯内部 163 名专家做的 203 个工程任务盲测里,它以 2.99/4.00 略优于 GLM-5.3(2.92)和 Kimi K3(2.94),配合 Hyra 又在三维 Blaschke–Lebesgue 问题上把体积下界从 0.380799 推进到 0.41104,距离 Meissner 四面体猜想只剩 2% 的 Gap(来源:IT之家)。

Hy4 + Hyra 把三维 Blaschke–Lebesgue 问题的下界推进到 0.41104
三维 Blaschke–Lebesgue 问题历史下界的推进:Hy4 preview + Hyra 把体积下界从 0.380799 提升到 0.41104,距离 Meissner 四面体猜想的 0.41986 只剩 2% 的 Gap。图片来源:IT之家

但今天真正值得写下来的判断,不是「腾讯又发了个大模型」,也不是把它的缓存价 20 倍差价当成「低 TCO 长上下文策略」来解读——那只是一个价格结构上的观察。真正被这次发布验证的,是一个更结构性的现象:Hy4 preview 已经能「做完」复杂项目,却不会回头验收自己交付的东西是不是真能被别人打开。这才是「preview」两个字里最值得留意的那一层。

三次实测里,同一种失败模式

InfoQ 拿 WorkBuddy 跑了三个真实场景,把它们并排放在一起看,会发现失败点惊人地一致。

第一个任务是「为 30 人开发团队采购 AI 编程工具」。 Hy4 preview 调用了十来个网页,甚至把 GitHub 2026 年 4 月 22 日暂停 Copilot Business 新自助注册这种冷门政策变化都抓到了。但报告最后卡在了一个非常朴素的问题上:Cursor Teams 的年付价格在 2026 年 6 月已经改成 Standard 32 美元 / 席 / 月、Premium 96 美元 / 席 / 月,Hy4 preview 却仍然按 40 美元 / 席 / 月算,结论一路错到底——「即使 Copilot Business 额度超支 100%,年成本 13,680 美元仍低于 Cursor Teams Standard 的起步价 14,400 美元」。实际上按年付口径,Cursor Teams Standard 三十人一年只要 11,520 美元。整份报告漂亮、深入、可以直接呈递管理层,但因为最后一次交叉校验没做,等于把一份错误结论送到了签字台上(来源:InfoQ)。

Hy4 preview 生成的采购报告成本对比表
Hy4 preview 生成的 AI 编程工具采购报告成本对比表:Cursor Teams Standard 被算成 40 美元 / 席 / 月、年 14,400 美元;实际按年付口径应为 32 美元 / 席 / 月、年 11,520 美元。图片来源:InfoQ

第二个任务是一个「四端项目作战中心」,要 Web、移动、桌面、3D 四端同时交付,8 个项目、17 个任务、KPI 和 3D 空间交互全部要跑通。Hy4 preview 在这个项目上表现让人惊喜:移动端专门做了 44 px 触控目标和 safe-area 处理,桌面端接了原生菜单和系统通知,3D 版本把「P003 逾期 9 天」、「P006 已完成 91% 却仍是高风险」这种边界数据都主动写进了测试。它甚至像个称职的架构师那样,主动抽出了共享数据层。但最终交付时,README 上写着「一键执行 147 项测试」,实际执行的第一步就失败了——一键测试脚本目录错了,两份浏览器测试写死了生成机器的绝对路径。会写测试,但没检查这些测试离开自己的机器还能不能跑(来源:InfoQ)。

第三个任务是 2026 Q3 季度经营复盘,给了 10 个附件、包含 12 个月脏数据(错误汇总表、缺失月份、重复订单、前后矛盾的会议纪要)。这次它跑完了完整的 17 步:文件盘点 → 数据校验 → 去重 → 发现缺失 → 发现公式异常 → 重算 → 同比环比 → 产品指标 → 客户信号 → 回查纪要 → 处理冲突 → 归因 → 风险 → 优先事项 → 数据质量附录 → 管理层摘要。中间 0 次人工干预。但第一版 Word 文档出现排版问题,改了两次才好——最后一步的交付格式,Agent 又没顾上(来源:InfoQ)。

把三次实测放到一张纸上,共性一目了然:它们都不是失败在「能不能做」,也不是失败在「逻辑推理不够长」——恰恰相反,第三个任务比第一个长得多,反而更稳。它们都失败在「给别人打开时能不能用」。数字比较报告能不能对得上口径,是「给别人打开」;README 上的一键脚本能不能真的一键跑,是「给别人打开」;Word 文档打开是不是排版正常,还是「给别人打开」。Hy4 preview 目前所有失误都长在同一片区域:它对「任务的语义完成」敏感,对「任务的交付审计」迟钝。

「最后一公里」是结构性的,不是版本问题

为什么会这样?因为大模型的训练奖励主要绑在「任务完成」上——按需求生成、按指令回答、按目标推理——但「回头把交付物再当成一个待办输入重新检验一次」这个动作,在训练分布里稀薄得多。人类工程师做完一个采购报告后会本能地打开 Excel 重算总数,做完一个 repo 后会 clone 一份到干净目录跑一遍,做完一份 Word 会打印预览再看一眼版式;这些动作看似琐碎,但恰恰不在 LLM 的强化路径上。。

苏晚
苏晚Su Wan

前途科技 · 前沿主笔

关注 AI 与前沿科技的观察者,前途科技前沿内容主笔。

查看全部文章

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」
置顶

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」

腾讯 Hy4 preview:一个能做完项目却不会自己验收的 Agent
置顶

腾讯 Hy4 preview:一个能做完项目却不会自己验收的 Agent

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
它学的是「如何完成」,不是「如何验收自己的完成物」

有趣的是,腾讯自己在 Hugging Face 上的 model card 里,把 "Tendency to over-verify its own work"(有过度验证自己工作的倾向) 明确列为 Hy4 preview 已知局限之一,与之并列的还有"Spending longer than necessary reasoning through complex tasks"(在复杂任务里推理时间超出必要)(来源:Hugging Face 上 tencent/Hy4-preview 模型卡的 Known Limitations 章节)。这两条与 InfoQ 三次实测放在一起看,反差很值得琢磨——官方以为它"过度验证",实测里它在推理链条内的确会反复自我校对,但那种自我校对是「让链条本身自洽」,不是「让最终交付物在别人的电脑、Excel、Word 里打开也能用」。前一个动作在训练分布里高度奖励,后一个动作几乎没有奖励信号。所以你会同时看到:模型在链条内啰嗦得让人想打断,模型在交付面却干脆没有回头看的动作。

顺带一提,model card 里公开的架构细节也解释了为什么这种"链条自洽"能做得这么深——注意力用的是 Gated DeepSeek Sparse Attention 配合 IndexCache(跨层稀疏索引复用)、内建 MTP 层做投机解码(10B/0.7B)、iHC 4 条残差流扩展层间信息流;GPQA Diamond 92.3、SWE-Bench Pro 65.7、SWE-Bench Multilingual 82.9(来源:tencent/Hy4-preview 模型卡)。这些是把中长程能力做到「接近可交付」的架构基础,但架构本身没有回答一个问题:谁来把交付物拿到干净环境里再跑一遍。

InfoQ 那位评测者的原话可以直接抄进任何一家中国企业的 AI 落地手册:Hy4 preview 已经像「一个相当能干的采购研究员」,但还不是「可以不复核就签字的采购负责人」(来源:InfoQ)。

对企业采购者,这决定了 Hy4 preview 到底该怎么用。免费两周的窗口值得抓——尤其是它的缓存命中价 0.042 美元 / 百万 tokens,跟 0.834 美元 / 百万输入之间有近 20 倍的价差,天然适合放在 RAG、跨文档协作、长上下文重复调用这类「同一堆资料反复喂进去」的工作流里,成本模型确实好看。但流程设计里必须显式留一个「人力交叉校验」节点——落到岗位上讲:金融、法律、审计行业的 RFP 与合同定稿环节,让业务负责人在签字前做一次「数字重算」(本文开头那份 Cursor 报价,就是死在没做这一步——一份三十席位、金额万美元级的采购决策,签字前那三十秒的复算才是最后一道闸);工程团队则要求 SRE / 运维在 Agent 交付的 repo 合入主干前,先在干净 CI 环境里 clone 一遍跑通全套测试(Dashboard 案例的 147 项测试就会在这一关被拦下);跨境合同、招投标文件、季度经营复盘这类正式文档,编辑或秘书要做一遍格式回验再对外发出。这不是不信任 Hy4——是所有 Agent 现在都不该被直接授予未复核的签字权。

另一条线:递归自我改进的中国"第二例"

这次发布还有一条线,很少被摘录,但值得单说。腾讯官方明确写道:Hy4 preview 首次参与了自己的训练——训练方法、数据策略、评估体系、底层算子的自动优化,「模型提出方案、运行实验并根据结果继续迭代」,形成初步的递归自我改进闭环(来源:腾讯官网、InfoQ)。另一件事是推理侧:Hy4 preview 自主分析推理系统瓶颈,围绕算子融合、通信优化开展多轮改造,端到端吞吐比基线提升 31.8%,在不同上下文长度和并发度下稳定收益(来源:腾讯官网)。

有必要立刻降温:这不是「AI 训练 AI」或者奇点转折。它更接近 AlphaCode / AlphaDev 那条路线——把训练管线里最枯燥、最可参数化的环节(评估集调度、算子搜索空间、数据配比)交给模型去搜索。它不改变「人写目标函数、人定安全边界」这件事,只是把「人写调优脚本」那一层自动化。它是一个工程步骤的自动化,不是一次范式转移。

也不能算「首例」——早在 7 月 Kimi K3 就公开写过「K3 写 K3 的 kernel,K3 设计跑 K3 的芯片,边训练、边用自己干活、边迭代」(来源:月之暗面 Kimi K3 发布材料);DeepSeek 侧 V3/R1 技术报告则更早展示了 RL 阶段模型对推理链条的自我修正与"aha moment",但那更偏向推理层而非训练管线(来源:DeepSeek-V3 technical report, arXiv 2412.19437)。相比之下,腾讯这次的表述比同期大多数中国大模型都更聚焦在训练管线本身(评估集、算子、数据配比、推理系统),Kimi K3 侧重工具链闭环,路径不同但方向一致——把"人写调优脚本"这一层交给模型,正在成为一线中国大模型团队的公开共识。

把这一点和前面的「交付审计缺口」放到一起看,会得到一个更有意思的判断:Hy4 preview 的能力增长曲线,越是靠近训练管线内部的自动化(评估、算子、推理优化)越顺,越是靠近面向人类交付的外部审计(数字复核、脚本可移植、格式回验)越弱。这跟一个数学系博士生的成长曲线很像:先学会自证明的自洽,再学会替读者思考。Hy4 preview 已经跨过了第一步。

「算力严重不足」下的两月一版

最后一条背景,来自腾讯集团高级执行副总裁、CSIG CEO 汤道生近日在内刊上的署名文章。他罕见地承认:「混元大模型经历了不同阶段,多次重构,混元 Hy3 架构化繁为简,更注重训练数据的质量,在同等参数的大模型中效果突出。但由于公司整体的算力严重不足,拖慢了模型训练与产品发展,产生了比较大的影响。」6 月他曾在采访中说腾讯算力「一直处于不太够的状态」,Token 调用出现爆发式增长,有限资源甚至要优先满足内部需求(来源:InfoQ)。

数字这样支撑:2026 年 Q2 腾讯资本开支 527.8 亿元,同比 +176%、环比 +65%,主要投向 AI 基础设施;上半年合计 847 亿元,一举超过 2025 年全年的 792 亿。二季度大规模 AI 基础设施投入和相关预付款甚至让腾讯自由现金流转为 -138 亿元(剔除算力采购预付款后仍为 +376 亿)(来源:InfoQ)。而节奏上,自 2 月重建基础设施以来,混元大模型平均每两个月迭代一版:4 月 Hy3 Preview、7 月 6 日 Hy3 正式版(2950 亿总参 / 210 亿激活 / 256K)、8 月 28 日 Hy4 preview——是硬扛出来的加速。

汤道生自己在同一篇文章里也提醒过「眼睛也不能只盯着模型这一层」。可这次 Hy4 preview 发布上最抢眼的进度条依然全都写在模型层:770B 参数、1M 上下文、递归自我改进、缓存 20 倍价差;真正决定企业能不能拿到价值的那一层——交付审计——仍然被留给了用户自己。模型层的进展会继续用两月一次的节奏发生,但企业能不能真的从中拿到价值,取决于流程里有没有为「最后一公里」留出人力节点——采购单的最终数字校验、交付包的可移植验证、复盘文档的排版审校,这些活 Hy4 preview 还接不下来,也不必勉强它接。等到明年这个时候,Hy5 或者 Hy4 正式版可能会把这些盲区补上一大半;在那之前,「能干的研究员,但不是能签字的负责人」是这个模型最准确的坐标。


本文基于腾讯官方发布页、Hugging Face 上 tencent/Hy4-preview 模型卡、IT之家 8 月 28 日报道、InfoQ 同日实测文章,以及 Kimi K3 发布材料与 DeepSeek-V3 technical report(arXiv 2412.19437)综合分析。AI 整理·编辑复核。

Open ASR 首次收录印地语:Monsoon 给中文语料的三条硬提示
置顶

Open ASR 首次收录印地语:Monsoon 给中文语料的三条硬提示

//

24小时热榜

AI时代,作品集证明不了什么
TOP1

AI时代,作品集证明不了什么

多数人低估了AI加速学习的能力
TOP2

多数人低估了AI加速学习的能力

3

Claude 17分钟破解20年旧系统,还抓出一个Bug

1小时前
Claude 17分钟破解20年旧系统,还抓出一个Bug
4

AI+3个免费工具,30天赚900美元的实操记录

1小时前
AI+3个免费工具,30天赚900美元的实操记录
5

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」

1小时前
索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」
6

AI双刃剑:创造与毁灭同行的未来

1小时前
AI双刃剑:创造与毁灭同行的未来
7

测遍Claude Code技能,这4个最值钱

1小时前
8

硅统治芯片60年后,接班人只有三原子厚

1小时前
硅统治芯片60年后,接班人只有三原子厚
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断