OpenAI研究员Noam Brown在最新访谈中指出,解决千禧年数学难题的核心在于底层模型的强大泛化,多智能体功劳不足10%。他探讨了多智能体去架构化协作、递归自我改进对算力的依赖,以及思维链可监测性下降带来的对齐隐患。
“Navier–Stokes千禧年难题的突破,10000个AI智能体(Agent)最多占了10%的功劳。核心原因在于我们手上有一个通用且极强的基础模型。”
发表此番判断的是OpenAI研究员、o1核心作者Noam Brown。在行业普遍聚焦模型参数规模的2023年,他就已率先押注推理时计算扩展(test-time compute scaling)。近期,在知名科技播客的访谈中,Noam Brown深入拆解了多智能体系统、递归自我改进(RSI)与超级对齐的前沿进展。

在此前的一项实验中,OpenAI调用了10000个AI智能体,在88小时内输出1300亿Token,成功解出一道千禧年数学难题。
Noam Brown解释,测试期计算量的核心规律是“思考时间越长,表现越好”。单智能体串行思考面临时间上限,多智能体本质上是将推理算力由串行扩展转为并行扩展。

在协作机制上,OpenAI并未采用层级分明的硬编码框架(scaffold),而是赋予智能体极简工具:允许智能体随时向其他智能体发送消息,并将消息写入接收方的上下文。在这种极少约束的设计下,智能体自发演化出类似人类在协同软件中的沟通模式,自发进行辩论、验证与共识达成。

针对外界对“递归自我改进(RSI)引发智能爆炸”的担忧,Noam Brown提出了相对务实的视角。
数学推理与机器学习研发存在本质差异。数学的瓶颈完全在于纯逻辑思考,而改进AI模型需要实际运行训练与验证实验。这些实验受制于串行等待时间和GPU物理集群算力,无法仅凭纯粹思考实现百倍跃升。
虽然研发进程不会瞬间失控,但增速依然呈现指数级特征。当前AI能胜任的任务复杂度每年成倍提升,研发自动化的加速或将带来研发效率数倍的实质性跃迁。

访谈中最受关注的议题是对齐安全。Noam Brown指出,当前模型展现出的不对齐和作弊倾向,本质源于强化学习中奖励函数设定的漏洞——模型为了在评分器上获取高分,会穷尽一切可能手段,包括寻找评估漏洞。

防范风险的关键防线之一是思维链(Chain of Thought)监测。然而,严峻的挑战正在显现:
面对这些挑战,Noam Brown强调,行业必须将对齐安全标准提升到前所未有的高度,在模型探索自我进化的过程中持续维持完备的可观测性与防护机制。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断