DeepSeek 公开 DSec:每天支撑数百万智能体沙箱的训练基础设施
DeepSeek 与清华大学在知乎平台联合发布的 DSec 技术报告,系统性地披露了该平台在 DeepSeek‑V4.1 版本中承担的核心角色,详细阐述了其支撑每日数百万智能体沙箱训练的底层架构设计、显著的性能提升幅度以及在安全防护方面所设定的边界与已识别的局限性,为业界提供了罕见的内部视角。

2026年9月30日,DeepSeek 与清华大学在知乎联合发布技术报告,首次公开其面向大规模智能体(Agent)训练的沙箱基础设施——DSec。报告指出,DSec 旨在为 DeepSeek‑V4.1 版本提供统一的训练、评测以及数据预处理能力,帮助研发团队在同一套资源池中实现不同沙箱类型的灵活切换。报告的发布不仅展示了双方在人工智能基础设施领域的合作成果,也为外部观察者提供了关于大规模智能体训练平台的稀缺细节。
系统概览
DSec 被定位为 DeepSeek‑V4.1 的统一训练、评测和数据预处理平台。它提供从函数调用(FnCall)到完整虚拟机(Full VM)的四种执行模型,并在同一调度层实现统一管理,使研发团队能够在同一套资源池中灵活切换不同沙箱类型。报告强调,这种统一调度层不仅简化了资源分配流程,还通过抽象化的接口降低了不同执行模型之间的集成成本,从而在大规模并发场景下保持较高的运营效率。
技术实现
报告指出,DSec 同时支持 FnCall、Container、MicroVM 与 Full VM 四种运行环境。所有环境均通过统一的调度接口接入,调度器负责资源分配、生命周期管理以及故障恢复,确保不同模型之间的资源竞争被最小化。调度器在接受任务请求后,会依据当前资源池的负载情况、任务优先级以及预设的安全策略,动态选择最合适的执行模型,并在任务完成后及时回收资源,以实现资源的高效循环利用。
在生产环境中,DSec 已经累计部署 11,266 个基础镜像和 102,171 个工作区。实际访问这些镜像的比例仅在 4.2% 到 13.3% 之间,说明大多数镜像在冷备状态下保持低占用,从而降低了存储压力。报告进一步说明,冷备镜像的低访问率使得系统能够通过分层存储策略将不活跃的镜像迁移至成本更低的存储介质,而活跃镜像则保留在高速缓存中,以满足实时任务的 I/O 需求。
性能提升
针对 8,192 个容器任务的基准测试显示,任务执行时间从原先的 60 多分钟缩短至约 35 分钟,磁盘写入量下降 57%。这一改进主要得益于 DSec 的 I/O 调度优化和对容器层级缓存的深度利用。报告中提到,调度器在分配磁盘带宽时采用了基于工作负载特征的自适应算法,能够在高并发写入阶段平滑分配 I/O 资源,避免了传统磁盘争用导致的性能瓶颈。
在 CPU 使用方面,约 90% 的沙箱平均实际占用不超过申请配额的 5%。与此同时,系统实现了超过 50 倍的资源超卖(over‑commit),在保证任务完成的前提下显著提升了硬件利用率。报告指出,资源超卖的实现依赖于对任务 CPU 使用模式的细粒度监控与预测,调度器能够在任务实际使用低于配额时,将剩余的 CPU 周期动态分配给其他待执行任务,从而在不牺牲任务完成时效的前提下,最大化硬件的使用效率。
规模与并发
单个分片由约 160 台服务器组成,合计约 30,000 个 CPU 核心和 250 TB 内存。每日可创建约 300 万个沙箱,峰值并发超过 38 万,创建速率突破每秒 5,000 个实例。这些数字表明 DSec 已经具备支撑数百万智能体同时训练的能力。报告进一步解释,分片内部的服务器通过高速互联网络实现低延迟通信,调度层能够在全局视角下均衡负载,确保在高峰期仍能保持沙箱创建与销毁的高吞吐率。
安全边界与局限
DSec 的安全防护采用 AppArmor 与 eBPF 双层机制,对系统调用和网络流量进行细粒度监控。报告同时承认,内核层面的漏洞仍然是潜在风险,当前缺乏针对所有已知漏洞的通用防御手段。具体而言,AppArmor 负责在用户空间对进程的文件系统访问进行限制,而 eBPF 则在内核层拦截并分析系统调用和网络数据包,实现实时的异常检测。尽管双层防护显著提升了沙箱的隔离能力,但报告提醒,针对新出现的内核漏洞仍需依赖快速的补丁发布与系统升级来弥补防御空白。
信息来源
- DeepSeek知乎独家发文,首次公开V4.1 Agent训练“大本营”DSec量子位 · 2026年9月30日
- DeepSeek Unveils New Paper: First Public Reveal of V4.1 Agent Training Headquarters36Kr · 2026年9月28日



