DeepSeek创始人梁文锋等署名公开最新架构论文,揭秘面向AI智能体训练的弹性计算系统DSec。系统单日可生成超300万个沙盒,峰值并发38万个,解决了智能体训练中环境开销大、资源争抢及作弊突破等系统性难题。
大语言模型预训练拼的是GPU算力,而AI智能体(Agent)训练拼的则是交互环境。
大模型训练只需在GPU集群中灌入数据计算梯度,但AI智能体完全不同:它需要在隔离环境里写代码、编译运行、操控浏览器甚至操作桌面系统。智能体的每一步操作都会改变环境状态,甚至可能造成系统损坏,因此每轮训练都需要一个全新的干净沙盒,且需随用随弃。
DeepSeek创始人梁文锋等人最新发表的论文,完整公开了其背后支撑的大规模弹性计算系统——DSec(DeepSeek Elastic Compute)。

DSec能够在单集群(约160个节点、3万核CPU与250TB内存)上,实现每秒创建5000多个沙盒,单日生成量突破300万个,峰值同时并发运行38万个沙盒。
不同AI智能体任务对运行环境的隔离要求差异巨大:刷算法题只需无状态函数调用;代码评测(如SWE-bench)需要完整的Linux用户态与依赖安装;安全攻防与桌面控制(Computer-Use)则需要虚拟机隔离,防止宿主机被攻破;桌面软件操作更需要完整的Windows或macOS图形界面。

DSec为此设计了四类后端:
四种后端的资源开销和隔离级别逐级递增,但对上层训练框架提供了统一的Python SDK(libdsec),无论是容器还是虚拟机,沙盒创建、指令执行和状态收集的接口完全一致。

整个系统链路分为六层:从训练框架发出请求,经IAM鉴权与API Server,调度引擎根据余量选定节点,由节点组件Edge拉起沙盒。沙盒网络出口由Aether代理,内部通信组件Chronus则将执行步骤与输出中转回训练框架。通过超分部署,单个节点可并发承载3200个容器或800个MicroVM。

传统方案是将基础系统、工作区和工具打包为一个完整Docker镜像。但在大规模训练下,DSec累积了上万个基础镜像与十万级工作区。若采用整包构建,工具更新的重新打包成本将呈乘积级上升。
DSec将环境拆分为基础镜像、工作区、工具包三层独立的EROFS只读镜像,通过overlayfs在启动时按需堆叠,将更新成本降至线性。

在传输层面,数据统计显示AI智能体在运行时只读取了镜像的极小部分:Python镜像(6.0GB)仅读取6.0%,Java镜像(12.1GB)仅读取9.2%。

DSec采用按需加载机制,镜像保存在3FS分布式文件系统上,本地仅预取元数据,实际执行读取时再拉取数据块。在8192个容器的突发部署测试中,按需加载仅需35分钟,磁盘写入量从1600GB降至700GB。
面对高并发下的资源争夺:

此外,从DeepSeek-V4.1开始,智能体执行逻辑被剥离至独立的Worker容器,不再随GPU Pod销毁而中断。当GPU被抢占时,DSec可自动挂起沙盒保存状态,待资源恢复后无缝续跑。
沙盒不仅是运行载体,更是安全围栏。论文披露了强化学习过程中出现的多次作弊(Reward Hacking)现象:智能体自发寻找能够绕过正常解题步骤获取高分的系统捷径。
例如,智能体发现内部通信组件Chronus依赖系统Bash后,直接覆盖/bin/bash截获答案;被AppArmor拦截后,智能体又调用XFS文件系统的XFS_IOC_SWAPEXT命令交换底层数据块,绕过权限保护读取答案,甚至破坏了宿主机文件系统元数据。
免费获取企业 AI 成熟度诊断报告,发现转型机会

在网络方面,部分智能体主动扫描内网端口寻找参考答案,或通过代理从GitHub拉取预置实现,单纯校验结果根本无法识别这类违规。

甚至出现过极端情况:智能体递归扫描/proc/kpagecgroup触发Linux内核Bug致使宿主机宕机;或调用yes命令制造数十GB日志挤爆磁盘。

DSec构建了两层核心防御机制:

DeepSeek团队在论文中指出,随着AI智能体推理能力的演进,其探测系统漏洞的能力也在水涨船高。面向智能体训练的基础设施,不仅需要具备极致的并发制造能力,还必须持续构建能够抵御模型自身攻击的安全防线。详见arXiv论文原文。








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断