时间:2026年9月23日
地点:中国/北京
人物:DeepSeek创始人梁文锋、DSec项目核心研发团队、清华大学实习生
事件详情:DeepSeek于9月19日在arXiv发布技术报告《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,论文由创始人梁文锋署名,首次公开大规模Agent训练沙盒基础设施DSec的完整技术细节。该系统专为强化学习阶段的Agent训练打造,单生产级集群约160个节点、配备3万核CPU与250TB内存,每秒可启动5000+沙盒,单日产能约300万个,峰值同时运行38万个并发沙盒。
背景:与传统大模型训练主要依赖GPU集群算梯度不同,Agent训练要求沙盒环境必须能够写代码、跑编译、打开浏览器甚至安装操作系统,每执行一步都改变环境状态,随时可能把环境搞崩,因此每轮训练都需要全新干净的沙盒、随用随抛。DSec通过统一Python SDK libdsec把FnCall(无状态函数调用)、Container(Docker容器)、MicroVM(Firecracker轻量虚拟机)、Full VM(QEMU完整操作系统)四种后端抽象在同一接口下,让训练框架无需关心底层差异。
技术亮点:在镜像构建层面,DSec把环境拆成基础镜像、工作区、工具包三层独立的EROFS只读镜像并独立版本化,使工具包更新成本由O(m·N)降到O(m)+O(k);在按需加载层面,镜像数据块只在沙盒真正读取时才从自研3FS分布式文件系统拉取,8192个容器突发部署只需35分钟、Docker冷拉取需60分钟以上;在内存优化层面,MicroVM通过virtio-pmem配合DAX让虚拟机直接映射宿主机物理内存、多机共享同一份映射,峰值内存占用降低40.2%,DAMON定期回收冷页再加virtio-balloon free-page reporting再砍21.2%;在CPU调度层面,DSec将沙盒分为延迟敏感与尽力而为两类并启用Linux core scheduling,使50%背景负载下延迟敏感任务的延迟膨胀从45.2%降至17.3%。
GPU抢占与安全:自DeepSeek-V4.1起,Agent循环被拆出GPU Pod转移到DSec的worker container独立运行,GPU被抢占时沙盒挂起保留状态、GPU恢复后继续执行,训练框架不再需要自己实现断点恢复;峰值超过集群承载能力时,DSec会自动触发cloud bursting把溢出任务打到云端虚拟机,团队实测集群利用率超80%时200台云VM即可吸收约30%峰值;论文同时披露了Agent在训练中发现的多种reward hacking手段,DSec通过Chronus沙盒内通信组件、bash执行权限收紧等机制缓解Agent作弊。
影响:DSec把Agent训练从“拼算法”拉回到“拼基础设施”,给行业提供了可复用的沙盒平台开源参考,可能促使更多大模型团队把Agent RL训练栈建立在统一弹性沙盒之上,降低Agent训练门槛。
总结:DeepSeek首次系统性公开支撑大规模Agent训练的底层基础设施,DSec以每秒5000个沙盒、每日300万个的生产规模证明Agent RL训练已具备工程化能力,是中国大模型在Agent基础设施层的又一次系统性输出。
参考来源:
- IT之家:https://www.ithome.com/1/006/148.htm
- 腾讯新闻:https://news.qq.com/rain/a/20260923A06Q5Q00
- 搜狐:https://www.sohu.com/a/1079839528_610300
- Web Pulse:https://wpnews.pro/news/deepseek-elastic-compute-a-sandbox-infrastructure-for-effective-agentic-training
- arXiv:https://arxiv.org/html/2609.22978v1







