阿尔伯塔大学研究团队提出持续强化学习框架 FAME,从数学层面严格定义环境距离与灾难性遗忘,并模拟人脑海马体与大脑皮层的双系统协同机制,让 AI 智能体在快速吸收新任务经验的同时,彻底摆脱“学新忘旧”困局。
今天教会机器人拧瓶盖,明天让它抓杯子,它很可能把拧瓶盖忘得一干二净。
人类很少出现这种状况。人脑拥有一套高度协同的记忆机制,新旧知识有序存储,学到新经验的同时不会冲刷掉既有认知。然而,这种终身学习能力恰恰是现有大模型与具身智能的核心短板——通过微调注入新知识极易引发“灾难性遗忘”;即便依靠超长上下文临时调用,也无法将经验真正固化到模型参数中。

针对这一痛点,强化学习学术重镇加拿大阿尔伯塔大学(强化学习先驱 Richard Sutton 任教高校)的研究团队提出了一套基于“快速学习+元学习”双系统的持续强化学习框架 FAME(Principled Fast and Meta Knowledge Learners),相关论文已公开于 arXiv。

传统强化学习默认环境是静态的,智能体只需在固定的奖励与状态转移中寻找最优解。但现实动态环境中,理想的智能体必须兼备可塑性(快速适应新任务)和稳定性(稳固旧经验)。两者天然存在张力,此前学界常采用的经验回放、参数正则化、策略蒸馏等方案,更偏向经验性补丁,缺乏清晰的理论底座。
阿尔伯塔大学团队从底层建立了两个核心数学定义:
借助这两套定义,持续强化学习的整合过程被清晰形式化为一个“最小化灾难性遗忘”的数学优化目标。
基于上述理论,研究团队受人脑海马体与大脑皮层协同工作机制的启发,设计了 FAME 框架的双系统:

系统的高效运作取决于两大核心机制:
一是自适应热启动。面对新任务,快速学习模块利用统计学假设检验执行 one-vs-all 判断:若历史经验有利,则基于元学习初始化加速起步;若新任务与上一任务极为贴近,直接选用微调;若完全陌生,则回退到随机初始化。

二是目标化知识整合。快速学习模块学完后,元学习模块依据最小化灾难性遗忘的目标吸收新知识。在离散动作空间中,该目标等价于增量极大似然估计;在连续动作空间中,则对应最小化 KL 散度或 Wasserstein 距离,以严格的数学逻辑串联起持续学习与多任务学习。
基准测试显示,在 MinAtar、Atari 及机器人操作基准 Meta-World 上,FAME 结合 DQN、PPO 与 SAC 等经典算法,在平均性能、前向迁移和防遗忘三大维度全面领先主流基线,并在任务序列越长时优势愈加显著。
随着行业对大模型和具身智能的探索深入,持续学习已不再只是强化学习领域的学术分支,而是通用人工智能(AGI)的核心瓶颈。
尽管单纯依靠 Scaling Law 能在一定程度上缓解浅层遗忘,但如果要迈向真正的超级智能,每次注入新数据都重新完整训练的做法从算力成本和效率上注定无法维系。从 DeepMind 的 Demis Hassabis 到 SSI 的 Ilya Sutskever,多位顶尖学者都曾强调:不能持续自我学习并构建长期记忆的系统,不可能抵达终极 AGI。
从 AlphaZero 到如今大模型的 RLHF,强化学习始终是驱动突破能力边界的核心引擎。阿尔伯塔大学的这项工作表明,持续强化学习完全可以跳脱打补丁式的经验范式,转变为有严谨理论支撑的系统工程,为自主进化智能体与具身机器人的落地提供了崭新路径。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断