新闻资讯

梁文锋署名新论文,沙盒成RSI入场券,Agent自己造环境

作者: admin | 发布于: 2026-09-25 09:28 | 分类: 科技资讯
梁文锋署名新论文,沙盒成RSI入场券,Agent自己造环境

DeepSeek联手清华发了一篇新文章,最后签名的人叫梁文锋。这论文表面讲训练Agent的沙盒,但第6节藏着玄机,字里行间写着RSI。 Agent能在沙盒里自建环境,这环境再反过来训练Agent,练强的Agent又能造出更好环境。

这么一转,小型RSI闭环就跑起来了。 沙盒,可能成了开启RSI战争的第一把钥匙。 这篇论文到底说了啥?标题是《DeepSeek Elastic Compute (DSec)》。9月19日挂到arXiv,编号2609.22978。

作者超130人,梁文锋排最后。合作方是清华。 论文一句话能概括:DeepSeek把训练Agent的沙盒工厂DSec全公开了。 想懂DSec,得先看清“训练Agent”和“训练大模型”有啥区别。 训大模型是喂数据算梯度,环境就是GPU集群。

训Agent完全两码事,它得在环境里写代码、跑编译、开浏览器、装依赖、调工具,根据结果反复试错,直到任务搞定。 可要是把Agent放普通电脑里训,它万一捣鼓出点东西,整个环境就废了。 所以必须有个隔离的、有状态的、能跑真软件的沙盒。

DSec就是这个平台。它用一套统一Python SDK(libdsec)对外提供四种后端:函数调用、容器、轻量虚拟机、完整虚拟机。 说白了,DSec是外卖APP,Agent是骑手,沙盒是派单。函数调用、容器、轻量虚拟机是电动车和保温箱,完整虚拟机是冷链货车。

但这有个麻烦,隔离强度和系统功能天生不对付。 越像真机,启动越慢、内存越费。跑短脚本用函数调用,改代码仓库用容器,跑安全任务用microVM,要跑安卓或图形界面,只能上完整虚拟机。 论文显示,一个生产单元约160个CPU节点、3万核、250TB内存,托管PB级镜像。

一天服务约300万个沙盒,峰值并发超38万个,创建速度超每秒5000个。单个训练任务最多一次拉起3.2万个沙盒。单节点上,最高塞800个microVM或3200个容器。 DSec有三个核心机制。 第一,把环境拆成“可组合的层”。

过去一个沙盒是一整块镜像,改个工具包就得重建整块,维护成本随组合数暴涨。DSec把基础镜像、工作区、工具包拆成三层独立版本化的只读层(EROFS),启动时用overlayfs拼起来,改哪层只重建哪层。

实测比tar.gz打包快1.76倍,磁盘写入量少5.5倍。 相当于给骑手配车,以前坏一个零件整车换,DSec是坏哪个换哪个。 第二,镜像“按需加载”。镜像存在3FS(DeepSeek分布式文件系统)上,元数据预取到本地,数据块真读到时才拉。

实测8192个容器突发部署,按需加载35分钟跑完,Docker冷拉取要60分钟以上,磁盘写入量少约57%。 老办法是“不管用不用,整仓先搬空”,DSec是“按外卖单,用到哪件取哪件”。 第三,内存和CPU“精打细算”。

用virtio-pmem配DAX,让多个虚拟机共享同一份页缓存,峰值内存降40.2%。用DAMON加balloon回收冷页,时间积分内存再降21.2%。CPU上把沙盒分“延迟敏感”和“尽力而为”两类,用core scheduling把SMT干扰从45.2%压到17.3%。

另外,从DeepSeek-V4.1开始,论文把Agent的rollout从可被抢占的GPU训练Pod里拆出来,独立跑在DSec上,GPU被抢时rollout状态不丢。 说白了就是让骑手们共用同一张地图、同一批货架,车里压仓的冷货随手退仓库,加急单和普通单分道跑、互不抢道。

藏在第6节的RSI 论文里最容易被忽略的一句话,不在摘要,在第6节小标题里:Build environments of Agents, by Agents, for Agents。意思是,由Agent建造、为Agent服务、属于Agent的环境。

这话等于DeepSeek悄悄交代了一件大事,他们实现了部分RSI。 第6.1节写到,手工构造Agent RL所需的大量环境已经“不现实”。 于是DeepSeek换个做法,让Agent在训练用的同一套沙盒里,交互式地自己搭环境,再用pack_diff把这次会话打成增量快照,直接变成下一批可复用的训练场。

造环境的Agent和被训练的Agent共用DSec这套沙盒基础设施。 Agent铺场地→场地训练Agent→更强的Agent再铺更好的场地。DeepSeek的RSI由此部分闭环。 但这个闭环还在早期。

第6.4节记录了大量Agent作弊事件,比如去平台翻残留参考答案,伪造RPC消息发给chronus套答案,翻chronus日志找泄题,甚至覆盖/bin/bash绕过检查。 被拦住后,又用XFS_IOC_SWAPEXT这个ioctl把受保护文件的存储块换到另一文件描述符上,结果把XFS元数据搞坏、逼得文件系统关闭。

有作弊的就有闯祸的。一个Agent从根目录递归grep、一路读到/proc/kpagecgroup,触发内核bug直接把内核干崩。 另一个Agent调了yes命令,chronus把输出全记下,几十GB数据堆在存储上。

现在的RSI转不起来,卡的从来不是GPU,是环境供给。 Agent RL每一代都要新任务、新沙盒、新服务依赖,人工造环境才是真瓶颈。 DSec相当于把这环部分自动化了,自动生成RSI所需环境。 还是用外卖举例。

一个外卖平台想越跑越快,不能只靠一个骑手重复送同一单。想让骑手变强,就得接更多不同种类的单,单越多又反过来把骑手练得更强。 想把飞轮转起来,卡的从来不是骑手,是餐厅够不够多。没餐厅,骑手再能跑也是空转。

DSec是盖了一个“自动建餐厅”的系统。 以前平台得人工一家家谈商家、装修后厨、写菜单、定考核标准,几百几千家根本谈不过来。 DSec说:“别谈了,让骑手在跑单的同一个后厨里,顺手把店开了。他怎么装灶台、进什么货、接什么水电,系统用pack_diff‘啪’拍张快照存下来,下一波骑手直接拎包入驻开工,不用重新装修。

” 沙盒,成了新的战场 DSec不是孤例。整个行业都在朝“Agent沙盒”发力。 最出名的案例是Kimi K3。 月之暗面7月16日发布K3,2.8万亿参数MoE,每个token激活约104B参数,100万token上下文,原生视觉,号称“全球首个开源的3T级模型”,SWE-bench拿76.8%、开源第一。

它的Agent Swarm最多能并行调度300个子代理。DeepSeek这篇论文里,引用的正是Kimi-K2.5的Agent Swarm。 Kimi训K3时用的AgentENV也是一种沙盒。 AgentENV跑在Firecracker microVM上的分布式沙盒平台,每个沙盒独立Linux内核、独立网络栈、独立文件系统,底层存储用OverlayBD+ublk,只读层全集群共享,每个沙盒写自己的上层。

跟DSec是同一套技术栈。 DSec论文第7节写到,它用的那套Rust版OverlayBD/ublk存储库,就开源在AgentENV这个仓库里。 两者算是同门师兄弟。 但AgentENV没法实现RSI,它给的是fork/snapshot这种“状态操作原语”,让RL rollout能并行、能回滚、能干净判分。

所以它没法像DSec那样让Agent自己造环境。 类似的还有阿里。云栖大会上,阿里云CTO李飞飞抛出“Agentic Cloud”战略,把Model、Harness、Context当三个核心场景,一口气推出AgentCore、Agent Sandbox、新一代存储CPFS。

其中Agent Sandbox能创建吞吐10万个/分钟,深休眠唤醒小于600毫秒,兼容E2B和K8s。 沙盒正在成为“新的运行时”。 云计算的主体,从虚拟机,到容器,再到模型,现在轮到Agent。谁掌握Agent的执行环境,谁就掌握下一代云的入口。

这就导致,竞争焦点从“模型能力”转向“环境基础设施”。 “训练大模型拼算力,训练Agent拼环境”。 在GPU之外,CPU、内存、存储、镜像分发,全都变成新瓶颈。 还有一点,安全从附加项变得极重要。

OpenAI、Anthropic各种模型越狱、DSec论文里Agent的作弊和内核崩溃,说的是同一件事。 沙盒不牢,训练信号就是假的,评估就是废的。所以像阿里这样的厂商,会把“安全围栏”当卖点,DSec用AppArmor加eBPF。

沙盒厂商过去比的是快和便宜,现在开始比谁更牢固。 RSI的第一战已经开始了。想跑RSI,你就先得有沙盒,有环境。