OpenAI与黄仁勋相继喊出“AGI已至”,但业界对于其真正定义仍存巨大分歧。模型基准测试高分背后往往依赖外挂系统,面对复杂现实流程依然频频碰壁。AGI正从技术衡量指标演变为资本与产业驱动的叙事工具。
OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后抛出一句话:“欢迎来到通用人工智能(AGI)时代。”紧接着,NVIDIA CEO黄仁勋也公开表示:“从ChatGPT到o1,再到GPT-6 Astra只用了四年。AGI已经到来。”
然而,负责关键评测的ARC Prize团队却明确澄清:模型确实代表了通用化能力的显著进步,但“我们并不声称它就是AGI”。
一边是高调宣布时代降临,一边是严谨否认。今天人人都在谈论通用人工智能(AGI),却鲜有人能说清楚:AI究竟做到什么程度,才算越过这条线?
GPT-6 Astra最引人注目的成绩,是在ARC-AGI-3基准测试中拿下了99.9%的惊人高分。该测试衡量的是模型面对陌生问题时现场理解、适应并解决的能力。
但这组数字背后有一个常被省略的前提:在官方提供的标准测试框架下,GPT-6 Astra得分仅为62.7%。只有接入OpenAI专用的适配框架——允许模型保留跨请求的隐藏推理状态、利用上下文压缩延续探索经验后,分数才跃升至99.9%。
62.7%测量的是单模型能力,99.9%衡量的则是一套经过高度工程优化的系统。两者存在本质区别,不能简单将基准跑分换算为“AGI完成度”。
此外,GPT-6 Astra在其他测试中暴露出短板:在高难度数学测试FrontierMath Tier 4上达到97.6%,计算机操作测试OSWorld 2.0得分72.6%;但在贴近真实办公流程的AutomationBench上跌至41.4%,复杂专业任务Agents' Last Exam也仅有59.3%。
这说明,只要任务边界清晰、答案明确可验证,前沿模型就能超越人类;一旦进入流程冗长、目标模糊的现实环境,系统仍会频繁失败。
当前行业对通用人工智能(AGI)缺乏统一共识,不同技术流派的标准大相径庭:
标准的不同不仅是学术之争,更直接决定了各家机构的研发路线、资源倾斜与产品形态。
技术革命往往被赋予标志性瞬间,但眼下的“AGI降临论”更像一种精心包装的商业叙事。
对模型厂商与产业链上下游而言,真实的技术突破通常零散且渐进。一句“AGI时代来了”,能将复杂的工程进展压缩为一个清晰的历史节点,为算力投入、融资并购和产品推广提供强有力的支撑。
黄仁勋的积极表态同样符合商业逻辑。大规模计算设施是驱动模型能力跃迁的前提,强调“AGI已至”,正是为了证明“更大规模的算力扩张仍然势在必行”。
正如知名AI研究者Andrej Karpathy所言,通用人工智能(AGI)的实现很可能不会是一条陡然拉起的拐点曲线,而是平滑地融入已有的增长之中,以至于当它真正渗透进现实世界时,人们甚至找不到拐点究竟发生在何时。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断