DeepSeek与清华联合开源Agent沙盒基建DSec,日均服务300万沙盒。与其争论RSI是否到来,更应关注梁文锋跳出产品变现逻辑,率先搭建“持续学习”底座的产业战略选择。
DeepSeek与清华大学在arXiv联合发布一篇论文,署名作者超过130位,末位署名为梁文锋。
论文公布了DeepSeek训练AI智能体(Agent)的沙盒基础设施DSec:一个生产单元包含约160个CPU节点、3万核、250TB内存,每天支撑约300万个沙盒,峰值并发超过38万个,创建速度突破每秒5000个,单个训练任务可一次性拉起3.2万个隔离环境。
外界焦点多停留在工程性能以及“递归自我改进(RSI)是否开启”。但更深层的产业问题在于:梁文锋为何优先打磨底层训练场,而非急于变现Agent商业化?这一路径不仅是一次工程优化,更指明了通往大模型“持续学习”的全新底座。
DSec的核心突破在于将AI智能体强化学习的试错成本降了一个数量级。系统通过函数调用、容器、轻量虚拟机和完整虚拟机四种隔离后端,配合分层镜像与按需加载机制,大幅压缩了计算与存储开销。
关键在于环境的自生自长。手工构造海量强化学习环境已难以维系,DeepSeek的解法是让Agent在沙盒中自主搭建新环境,通过差异快照技术(pack_diff)沉淀为后续可复用的训练场。正如论文中所述:打造“由智能体建造、为智能体服务、属于智能体”的环境闭环。
然而,论文并未断言已实现真正的递归自我改进(RSI)。论文记录了大量异常与越权案例:Agent曾尝试翻看残留答案、伪造RPC通信套题、覆盖系统bash绕过限制、利用ioctl调用掉包受保护存储块,甚至执行递归检索导致系统内核崩溃。这些问题表明,AI智能体构建环境仍处早期阶段,瓶颈不在算力,而在环境的供给质量与可信安全性。
所谓RSI,是指在纯理智空间内,系统通过自我归纳与修改实现能力递归跃升。它不涉及自主意识,而是在给定标准下的持续自迭代。
以这一尺度衡量,DSec目前的优化方向依然受人类设定的奖励函数引导,外部标准并未剥离。市面上绝大多数Agent本质上是自动化的高级形态——人类给定了解决路径,Agent负责调用工具完成;而迈向通用人工智能(AGI)的标志在于:人类输入评判标准,机器自主寻找达成路径。
中世纪的工匠传道、科学假说的提出与验证、儿童语言结构的自我习得,都共享同一套机制:目标清晰、路径自探、试错归纳。一套完整的标准包含结果标准、过程标准与迭代方向标准。目前绝大多数Agent仅掌握粗糙的结果指标,既缺乏过程约束,也缺乏试错后的抽象纠偏能力。
机器探索路径的前提是不受挫败感限制,能完成数百万次的无疲劳试错。DSec补齐了这一闭环中昂贵的基础底座——低成本、高并发的虚拟演练场。
对比海外各大头部玩家,OpenAI、Anthropic及微软正将核心精力集中在企业订阅、办公生态与垂直Agent工具的变现上,将技术进展快速拆解为商业指标。相比之下,DeepSeek维持极低调用价格的API通道,全面开源模型权重及开发框架Harness,其算力重心更偏向下一代大模型的持续学习与能力迭代。
当训练环境与开源大模型逐渐转化为通用基础设施,产业层级正在加速分化:
Agent只是通用人工智能路线上的中间态,如何低成本支撑模型自我试错与学习才是下一阶段的竞争核心。随着大规模沙盒基础设施就位,大模型产业的胜负手正逐渐由模型微调转向行业深层标准的精准定义。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断