大模型从问答走向复杂任务执行,传统扩展范式面临瓶颈。在外滩大会智能体论坛上,多位顶尖学者与产业专家指出,通过构建交互环境、强化学习与递归自演进,AI智能体正从被动执行迈向自主发现与经验积累。
当大语言模型开始调用工具、执行复杂长流程任务,行业衡量其能力的标准正在发生根本转变:不仅要看模型能否给出正确回答,更看重其能否在动态真实环境中持续行动、自我校验并据此调整策略。
在2026 Inclusion·外滩大会上,多位来自产业界与学术界的研究者围绕“Agent后训练:智能本质与下一个 Scaling Law”展开深入探讨,勾勒出一条从被动执行到自主进化的关键路径。

CAMEL AI 创始成员谢钰溱指出,探索 AI 智能体的 Scaling Law 可以拆解为三个关联维度:智能体数量、所处交互环境及自身进化机制。

在数量上,核心在于去中心化环境下的多智能体通信与自组织协同;在环境维度,“环境之于智能体,犹如数据之于模型”,高复杂度交互环境的构建与防作弊验证至关重要;而在进化维度,当智能体具备长程执行能力后,能否在实践中沉淀经验、自主纠错并反哺下一代模型,将成为推开下一代 Scaling Law 大门的核心钥匙。
蚂蚁百灵大模型负责人周俊强调,AI 智能体的落地不限于写代码,更涵盖医疗、金融与法律等专业领域。在工业级实践中,模型需要具备高质效、可专业化与可信执行三大特征。

“一个优秀的智能体,重要的不仅是知道下一步该做什么,更在于清楚哪些边界绝不能擅自跨越。”周俊表示,当前重点是构建能够识别风险、在证据不足或权限不足时主动引入人类接管的可靠架构。场景本身不会直接转化为模型能力,唯有将实战中的失败案例转化为可复盘的交互训练环境,才能驱动模型在专业工作流中真正演进。
随着智能体训练复杂性提升,算法验证周期成为研究瓶颈。英伟达研究员胡健介绍了面向研究的轻量级强化学习框架 Molt。

该框架基于 PyTorch 原生能力构建,核心代码仅约 9000 行。在确保大规模训练与流式采样的前提下,极简设计不仅便于研究人员灵活调整损失函数与策略,也为编程智能体理解代码库、协助算法研发提供了低门槛环境。
美团 LongCat 主任研究员顾奇分析了长程智能体(Long-horizon Agent)的落地瓶颈。长任务往往面临反馈稀疏难题,模型不能仅在全流程结束后才获得奖励信号,必须通过环境设计、任务分段与动态信息管理(Harness)协同解决。

在生成领域的规模化落地中,新加坡国立大学博士生孙彦分享了长视频生成的 Agent Harness 设计。面对长视频角色一致性与叙事连贯性的挑战,团队将剧本规划与生成制作方案拆离,通过前置结构化编排与依赖图并行校验,大幅降低了长序列多模态生成的返工损耗。

清华大学助理教授、超衍智能创始人陈勇超提出,自进化大模型应迈向未知领域的自主发现。针对科研探索过程数据稀缺的现状,团队通过构建研究任务环境,让 AI 自主产生试错轨迹并用于后训练,推动模型从求稳的工程改进转向具备假设检验能力的科学发现。

上海交通大学副教授陈思衡进一步阐述了递归自演进(RSI)路径:上一代 AI 系统能否自动迭代出更强的下一代系统,并逐步脱离人工干预。其团队在 35B 模型后训练实践中,通过科研环境交互与数据闭环,使模型在 Frontier Science 基准评测上的得分从最初的 1.7 分跃升至 46.2 分,验证了数据自迭代驱动能力泛化的可行性。

KAUST 博士、Recursive 创始成员诸葛鸣晨则梳理了从早期哥德尔机到现代自我改进智能体的脉络。他指出,随着编程与推理能力成熟,通过多智能体协作图结构动态优化自身流程,并引入 Agent-as-a-Judge 进行经验反馈,正让自演进系统迈向可用阶段。


在复旦大学副教授桂韬主持的圆桌讨论中,嘉宾们达成共识:单纯堆叠参数规模并不必然提升工具调用和行动策略能力,这常导致逆缩放现象。监督微调(SFT)负责赋予基础探索能力,而强化学习与高保真交互环境则是突破能力上限的核心引擎。AI 智能体的未来,在于能否将单次探索行动内化为可迁移的认知资产,在不断与真实世界交互的过程中,寻找通往通用人工智能的全新扩展定律。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断