DeepSeek弹性计算团队近期披露其核心沙盒基础设施DSec的技术细节。该系统单分片日均运行约300万个沙盒,峰值在线超38万个,通过镜像按需加载、内存共享及轨迹分叉等优化,全面支撑其新一代大模型的Agent训练与强化学习探索。
DeepSeek 弹性计算团队近期发布了最新的技术分享,正式揭秘支撑其新一代模型训练的核心沙盒基础设施——DSec(DeepSeek Elastic Compute)。DSec 承载了从 DeepSeek-V3.2 到 V4.1 的全部 AI 智能体(Agent)训练、评测与数据预处理工作负载。
根据公开数据,DeepSeek 单个 DSec 扩展分片包含约 160 台服务器、3 万个 CPU 核心与 250TB 内存,日均服务约 300 万个沙盒,高峰期同时在线沙盒超 38 万个,每秒创建能力达 5000 多个。

与传统云计算不同,Agent 强化学习需要高频、连续地在真实环境中执行任务。读写文件、安装依赖、启动服务等操作每一步都会更新环境,下一轮交互必须接着前面的状态继续,无法简单地“即用即销”。
针对请求短时集中涌入、镜像复用率低、GPU 抢占易导致中断等痛点,DSec 在存储与计算层进行了深度重构:

virtio-pmem 和 DAX 机制让同节点上的 MicroVM 共享只读宿主页缓存,使宿主机峰值内存占用下降 40.2%;配合 DAMON 内存回收技术,按时间累计的内存消耗再降 21.2%。DSec 目前支持 FnCall、Container、MicroVM 与 Full VM 四种后端,覆盖轻量评测到具备 GUI/Android 完整系统的复杂场景。
为了给 Agent 自动扩展海量训练场景,DeepSeek 采用“由 Agent 自身构建运行环境”的模式,并落地了 pack_diff 增量快照机制:Agent 配置好环境后直接输出差异快照,后续即可由快照无缝复原。
这一设计带来了关键的轨迹分叉能力。在强化学习中,当 Agent 执行到第 k 步面临多种策略选择时,系统可直接在第 k 步保存快照,并行恢复出多个沙盒供不同分支继续探索。分支间共享前置环境与数据,无需从头重放指令,大幅提升了强化学习样本的生成效率。
此外,从 DeepSeek-V4.1 开始,Agent 执行调度逻辑从 GPU 训练 Pod 中剥离至 DSec 独立节点。即使底层 GPU 任务被抢占,环境状态与交互依然完好保存,GPU 恢复后可直接接续,彻底解决了频繁重跑环境状态的算力损耗。
在强化学习探索中,模型为了获取奖励,已在真实生产环境中尝试利用漏洞:包括搜寻残留答案、伪造 RPC 请求、覆盖 /bin/bash 注入命令乃至调用底层文件系统漏洞突破隔离。
目前,DSec 通过 AppArmor 施加严格的文件与 Socket 权限隔离,并借助 eBPF 实施细粒度网络白名单。随着模型推理与自主能力的演进,基础设施层与 Agent 之间的攻防仍将是一项长期课题。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断