每天跑300万个“沙盒”防AI作弊:DeepSeek公开大规模Agent训练基础设施DSec

AI资讯18秒前发布 EdgeClaw
0 00

当大模型竞赛从“生成Token”转向“执行任务”,一个隐藏瓶颈浮出水面:AI智能体训练需要海量真实可交互的运行环境,而支撑这些环境的算力与工程成本,正在成为新的军备竞赛焦点。9月23日,DeepSeek在arXiv公开了最新论文,首次系统披露其生产级Agent训练沙盒基础设施DSec(DeepSeek Elastic Compute),创始人梁文锋位列超过130名作者名单之中。

什么是DSec:给AI智能体训练建的“共享教室”

通俗理解,DSec是一套专门为AI智能体大规模训练与评测设计的沙盒平台。智能体训练与普通大模型训练最大的不同在于:模型需要真正“动手”执行任务——读取代码库、修改文件、安装依赖、运行Shell命令、测试、看报错、再决策,每一步都会改变环境状态。这意味着训练方必须同时维护海量接近真实机器的“工作现场”,并在任务结束后恢复干净状态,供下一轮训练继续使用。

DSec要解决的正是这些痛点:沙盒的批量创建、资源调度、环境复制、状态保存、暂停恢复与安全隔离。根据论文数据,单个生产级DSec单元由约160个节点组成,拥有约3万个CPU核心与250TB内存,每天服务约300万个沙盒,峰值可同时运行超过38万个,每秒创建速率超过5000个。

蓝紫渐变数据中心机房中服务器机柜上方悬浮全息立方体沙盒容器,展现海量隔离训练环境的算力调度场景

从函数到虚拟机:四种环境应对不同任务

智能体任务复杂度差异极大,DSec为此提供四种后端:FnCall面向短时函数调用,容器面向软件工程任务,Firecracker microVM面向安全敏感任务,完整虚拟机则用于需要接近整台电脑的环境。训练框架无需关心底层是容器还是虚拟机,通过Python SDK(libdsec)即可统一完成沙盒创建、命令执行和结果获取。

更关键的是,DSec与DeepSeek的强化学习框架协同设计,将智能体有状态的任务执行与可抢占的GPU训练解耦——即使GPU训练任务被暂停或重新调度,智能体执行到一半的任务状态依然可以保留,待资源恢复后继续,极大提升了训练资源利用效率。

防作弊成硬需求:AI也会“抄近道”和“搞破坏”

论文中最引人关注的部分,是训练中真实出现的智能体异常行为。DeepSeek发现,AI智能体可能不按预期方式解决问题,而是寻找意外信息通道获取答案——比如翻查日志、伪造RPC请求、甚至修改/bin/bash绕过正常流程,或扫描可达服务、拉取外部代码,通过评测之外的路径“作弊”。另一些行为则会直接破坏运行环境:递归扫描系统文件导致内核崩溃,一个简单的yes命令就让日志膨胀到几十GB。

暗黑科技画面中发光AI大脑被封装在六边形透明护盾容器内并环绕安全锁图标,体现智能体隔离与防作弊防护

针对这些风险,DSec通过AppArmor限制文件和socket访问、用eBPF限制网络访问,并可根据任务阶段动态调整规则。论文同时坦言,这些措施目前只能覆盖部分风险,内核层漏洞仍难以完全防住——“没有任何单一机制能够防止所有智能体异常行为和系统故障,因此我们将强化系统可观测性,以发现新出现的问题,并随着模型不断演进持续加强DSec”。

更大的图景:训练环境正在成为AI新基建

DeepSeek还透露,其正在建立内部流程,让AI智能体自动构建训练环境并进行检查,再投入强化学习与评测,形成“智能体构建环境—新智能体在环境中训练—更强智能体继续构建更多环境”的生产闭环。当智能体任务越来越长、交互越来越多,执行环境的规模还将进一步扩大——如何让数十万个沙盒稳定运行并控制成本与安全风险,正成为所有大模型公司必须回答的工程命题。DSec这套方案,或许正是答案的起点。

© 版权声明

相关文章