递归自我改进(RSI)正成为AI圈热门话题。当AI系统开始编写自身代码,我们该期待什么?本文深入拆解RSI的现实边界、技术瓶颈与三种可能的未来图景。
一道数学题摆在面前:如果AI系统能写出比自己更强的AI代码,那下一步会发生什么?
Anthropic和OpenAI都透露过,Claude和GPT的代码库中超过80%是由它们自己写的。这引发了一个直击灵魂的问题:当AI能够完全独立编写出比自己更聪明的下一代时,会发生什么?
这个现象被命名为递归自我改进(Recursive Self Improvement,RSI)。概念本身不新——1965年数学家I.G. Good就提出过“智能爆炸”:一台超智能机器能设计出更智能的机器,最终人类的智慧将被远远甩在后面。这后来也被称为“奇点”。
很多人把AI想象成一个黑箱:输入问题,输出答案。但AI是造出来的,背后有成百上千个决策点。
以LLM(大语言模型)为例,构建一个模型需要做出一系列“烹饪”一样的选择:
基于上述复杂性,RSI带来的自我改进可能走三条路:
指数级加速,人类无法理解也无法控制。很多VC被这个前景驱动(术语叫foom,是加速冲向无穷大的拟声词)。但这需要革命性的新架构和无限的数据,当前的计算基础设施根本撑不住。
改进以人类能跟上的速度进行,每次创新人类都能理解。AI可能更快地找到优化方案,但不会超出人类的认知框架。即便到了某个“卢比孔河”点,人类仍然有能力干预——关闭服务器、断电、甚至扔EMP。
更像S型曲线:指数增长后遇到天花板——数据瓶颈、能源限制、物理极限。收益递减规律最终会让进步放缓。很多自然界的现象(比如生物进化)都是这种模式。
进化算法:随机生成大量网络配置,用适应度函数筛选,变异、复制,迭代出更优的模型。这不算真正的“自我改进”,因为它改进的是另一个东西。
自对弈强化学习:AlphaGo的成名套路。多个智能体互相博弈,最强的一个被冻结,其他的学习去击败它。循环往复。
现在有了LLM写代码的能力,RSI的闭环真正形成了:一个编码LLM写出训练另一个LLM的代码,新LLM再改进上一代。理论上,它甚至能优化自己的RSI循环策略,但实验成本极高——训练一次完整的新模型动辄几周甚至数月。
从收益递减规律看,低层优化(架构细节、硬件调度)会逐步收敛;新数据的获取越来越难、越来越贵;高层架构革命需要海量试错,当前算力无法支持。
因此,硬起飞不太现实。软起飞更可能——人类仍有时间理解并介入。甚至我们可能已经处在渐近线阶段:AI能力在接近某个上限时放缓,而那个上限远低于“超越人类理解”的水平。




RSI正在加速AI的进步,但眼前的成果更多是计算效率的提升,而非智力飞跃。真正让AI“变聪明”的因素——新数据和新架构——即使有RSI,也很难轻易获得。
如果奇点真会到来,大概率是软起飞。而且无论软起飞还是渐近线,安全、控制与治理的问题本质上是一样的:我们还有时间,也还有选择。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断