能够编辑代码库的 AI 智能体需要一个可运行命令、并能在多个回合之间保留结果的环境。在训练规模下,可能需要同时启动数千个这样的环境,然后等待模型决定下一步操作。DeepSeek 于 9 月 19 日发布了DeepSeek 弹性计算(DSec)技术报告,介绍了该公司称可处理这类工作负载的沙箱系统。
作者介绍了请求处理路径、镜像存储方式,以及训练任务被中断时的处理方法。报告中的性能和部署数据来自作者自己的测量。扩展版报告提交至 arXiv;摘要称,此前一份两页的扩展摘要曾接受会议第一轮评审。
主要变化
- 发生了什么变化:DeepSeek 将 DSec 描述为用于智能体训练和评估的共享平台。通过一套内部客户端库,平台可提供函数调用、容器、微型虚拟机和完整虚拟机。
- 为何重要:报告将智能体训练与同时维持大量任务环境运行的基础设施联系起来。请求依次经过授权、节点分配和本地准入;环境在创建时组合各层,并按需获取镜像数据。GPU 训练任务被抢占时,训练流程可以暂停保留状态的沙箱。
- 接下来关注什么:调用方仍需选择后端。论文的生产工作负载测量涵盖容器和微型虚拟机,两者使用不同的存储路径,资源成本也不同。报告中的规模数据描述的是一个 DSec 单元。
一个请求,四种沙箱
据论文介绍,DeepSeek 的训练框架、评估框架和数据流水线会调用一个名为libdsec的 Python 库。典型的创建请求会选择后端和环境制品,设置 CPU 和内存限制、运行时长和网络规则,并提供初始用户上下文。沙箱就绪后,调用方可以运行命令或工具调用、收集输出和返回状态,并停止会话。论文中的示例会话使用容器,设定内存上限和空闲超时,并配置允许访问 PyPI、但拒绝访问 NPM 的网络规则。论文介绍的是 DeepSeek 平台内部使用的接口,并非对外访问途径。
四种后端适用于不同任务。FnCall 在可复用的预先创建容器中运行短时、无状态任务,避免每次调用都新建沙箱。容器适用于代码库操作和一般工具使用,启动快、部署密度高,但在其宿主虚拟机中会与其他容器共用内核。Firecracker 微型虚拟机为需要更强隔离的任务提供虚拟机级边界,但启动和内存开销更大。完整虚拟机适用于需要轻量后端无法提供的操作系统或图形工作负载。作者称,容器和微型虚拟机占生产实例和资源使用的大多数。这些是论文所述的设计选择,并非经过测量的安全性比较。
在客户端背后,DSec 会对管理请求进行身份验证,根据定期刷新的健康和负载视图选择节点,再将请求发送至该节点的edge服务。本地边缘节点会在创建沙箱前检查容量;如果集群信息已过时,导致节点分配不合适,它可以拒绝该请求。运行中的容器和虚拟机沙箱使用名为aether的代理,以及名为chronus的 shell 会话进程来执行命令、文件操作和流式输出。FnCall 则通过预先创建的容器走另一条路径。这个区别很重要,因为单一客户端入口并不能消除执行方式和故障处理上的差异。
构建环境,无须整体复制
论文指出,典型智能体环境由三个部分组成:基础镜像、任务工作区,以及可独立变化的工具包。如果把每种组合都打包进一个镜像,每次工具包更新就会迫使团队重新构建大量镜像。DSec 改为叠加只读层,并在顶部增加可写层。对于容器,经过修改的 Docker 运行时使用 overlayfs 组合这些层。微型虚拟机使用只读 EROFS 层和可写磁盘;遇到文件系统兼容性要求时,则采用不同的块存储路径。
作者报告称,某个生产周涉及 11,266 个容器基础镜像和 102,171 个容器工作区。如此多样的环境降低了在每个节点上保留完整镜像的价值。DSec 将只读镜像数据存储在 DeepSeek 的 3FS 分布式文件系统中,将写入数据保存在本地存储,并在沙箱读取镜像内容时再行获取。容器镜像元数据会复制到本地,因此常规路径查找无需远程读取。微型虚拟机路径使用 OverlayBD,ublk并通过本地缓存处理块读取和增量快照。
在另一项独立的 10 节点评估中,作者在智能体评估负载下启动了 8,192 个容器。按需 EROFS 路径约 35 分钟完成任务;冷启动并提前拉取完整镜像的方式耗时超过 60 分钟;完全缓存的基准配置也约 35 分钟完成。作者报告的磁盘写入量为:按需加载时每个节点约 700 GB,提前拉取时超过 1,600 GB。这些数字仅比较作者测试中的配置,不能证明其他镜像集合或存储系统也会获得同样的提升。
让空闲会话和中断的运行保持可用
智能体沙箱可以在命令之间等待,同时保留文件、进程和内存。作者对一周样本的分析发现,约 90% 的容器和微型虚拟机沙箱平均使用的 CPU 容量不超过其请求量的 5%。因此,DSec 会尝试在节点上容纳大量活动会话,同时控制内存浪费和资源争用。对于微型虚拟机,论文介绍了通过virtio-pmem结合 DAX 共享只读文件缓存,并通过 DAMON 和气球驱动报告可释放页来回收客户机中的冷页。论文还介绍了利用 Linux 调度控制,将对延迟敏感的任务与尽力而为的工作分开。作者报告了这些机制在其评估中的收益,同时也说明了权衡,例如使用virtio-pmem时瞬时 CPU 使用率更高。
训练中断会带来另一个问题:GPU 训练任务被抢占时,运行流程可能仍保留有用状态。作者称,从 DeepSeek-V4.1 开始,DSec 会将智能体循环放在可被抢占的 GPU 资源池之外,运行于工作进程容器和智能体沙箱中。训练任务之后可以重新连接到该状态。训练暂停时,框架可以请求 DSec 暂停相关沙箱并回收内存。容器会被冻结并回收;微型虚拟机则会在 Firecracker 进程停止前,将执行状态保存为快照。之后可以恢复沙箱。这是论文对 DeepSeek 训练集成方式的说明,并不构成通用的恢复保证。
这些规模数据能够说明什么,不能说明什么
DeepSeek 称,一个 DSec 规模单元拥有近 160 个 CPU 节点、约 30,000 个核心和约 250 TB DRAM。该公司报告称,单元内典型日实例数约为 300 万,峰值并发约为 38 万,创建速率超过每秒 5,000 个实例。这些是作者报告的单个规模单元生产数据,并非经独立审计的 DeepSeek 全部集群总量。论文中的评估实验是在另一个 10 节点集群上运行的。
报告还介绍了故障边界。作者回顾称,智能体曾通过非预期渠道寻找答案,普通命令也曾导致内核崩溃或因输出过多而占满存储。作者介绍使用 AppArmor 文件和套接字控制,以及每个沙箱独立的网络规则来降低风险,同时明确指出,这些控制措施无法防止所有有害行为。论文没有公开 DSec 服务端点、外部 SDK 分发方式、访问条款或价格。它记录了系统设计和作者测试的条件,但没有提供运行示例代码的外部访问途径。
来源与延伸阅读
- Huang 等人:《DeepSeek 弹性计算(DSec):面向大规模高效智能体训练的沙箱基础设施》,arXiv:2609.22978v1,2026 年 9 月 19 日。这份完整技术报告是有关 SDK、后端、架构、环境存储、训练集成、局限性和作者所做评估的主要来源。第 2 和第 3 节介绍请求路径,第 5 和第 6 节介绍各项机制,第 8 节介绍测试设置与结果。文中的运行数据尚未就本文进行独立核实。
- arXiv 第 1 版摘要和提交记录。该记录列出了提交日期、31 页报告的状态,以及此前两页扩展摘要有限的评审经历。它并未证明扩展版论文经过了同行评审。



