DeepSeek 在 9 月 19 日提交、本周被广泛报道的一篇 arXiv 论文(arXiv:2609.22978)里,公开了给 Agent 训练造"沙盒"的生产系统 DSec(DeepSeek Elastic Compute):统一函数调用、容器、microVM 与全虚拟机四种沙盒后端,协调集群调度与 RL 训练负载,每秒可产出 5000+ 个沙盒、一天最多 300 万个、峰值同时运行 38 万个;支撑它的单集群约 160 个节点、3 万 CPU 核与 250TB 内存。论文作者超过 130 人,创始人梁文锋署名。
[1][2]nut graf:当行业还在争论"Agent 训练到底差什么"时,DeepSeek 用一份工程报告给出了自己的答案——差的不是模型,是环境工厂。大模型训练拼算力,Agent 训练拼的是能批量生成、可并行验证的沙盒环境;DSec 把"造环境"这件事从实验脚本升级成了生产级基础设施,等于把 Agent 的强化学习从实验室搬进了工厂。梁文锋署名本身也是信号:这不是某个小组的 side project,而是公司级基础设施。
机制上 DSec 解决的是 Agent 训练特有的环境瓶颈。Agent RL 需要每个样本对应一个可执行、可观察、可验证的沙盒,传统方案要么手动造环境(慢),要么靠云端虚拟机(贵且调度慢)。DSec 的做法是把四种隔离粒度(函数调用/容器/microVM/全 VM)统一到一个 SDK 背后,按任务需要选后端;环境由独立版本化的图层组合而成,镜像按需从 Fire-Flyer File System(3FS)集群分布式文件系统加载;内存共享、回收与 CPU 调度协同实现高密度执行——这些细节凑在一起,才撑得起"秒级 5000+ 沙盒、日 300 万"的量级。对产业的意义有二:一是它把"Agent 训练环境成本"显式变成了可工程化的指标(沙盒/秒、密度/核),二是 130+ 作者的工程报告说明这一层基础设施的复杂度和团队投入,已经和当年大模型训练框架的工程化一样重。
口径与边界:这是 DeepSeek 自己的技术报告,数字(5000+/秒、300 万/日、38 万峰值、160 节点/3 万核/250TB)均为论文自报,未经第三方审计;报告偏系统设计与经验数据,没有给出"DSec 使某基准提升 X%"这类端到端效果对比。把它和 DeepSeek 一贯的工程风格放在一起看,这篇论文更像是给行业的一份"环境工厂"施工图:谁想认真做 Agent 训练,基础设施这一课迟早要补——DSec 公开的价值不在炫技,而在把路径摊开让人抄。
[1][2]