9月23日,DeepSeek公开的一篇关于智能体训练的新论文引发关注。这篇31页的论文介绍了其内部使用的生产级沙箱平台DSec(DeepSeek Elastic Compute),论文作者超过百人,梁文锋也在其中。

如果说大模型训练是要让AI学会思考,智能体训练则是要让AI能动手,包括检查代码仓库、调用工具、执行命令,与任务特定服务交互等等,再根据运行结果调整下一步。而每次训练都需要一个与外界隔离、又能记住此前操作的环境,这就是“沙箱”。当成千上万个智能体同时“开工”,难题也从模型本身延伸到了如何快速、低成本地提供这些沙箱。
DSec是DeepSeek给出的方案。这也可以理解为是一个支撑智能体训练与评测的计算平台:研究人员可通过统一接口,按任务选择短时函数调用、容器、微型虚拟机或完整虚拟机。
论文重点介绍了几个核心技术机制,包括可组合环境层、按需镜像加载、高密度资源管理,以及DSec与强化学习框架的协同设计等。
论文称,单个训练或评测任务最多可能一次申请3.2万个沙箱。不同任务所需的代码、软件依赖和工具各不相同,如果每开一个沙箱都重新下载、解压完整镜像,会增加负载。DeepSeek将基础系统、任务工作区和工具包拆成可独立更新的部分,创建沙箱时再组合,镜像数据则按需读取。
沙箱运行起来后,还有一笔资源账。智能体执行命令后,通常要等待模型生成下一步动作。论文统计,约九成容器和微型虚拟机沙箱的平均CPU使用量,不超过其申请容量的5%。但它们修改过的文件、安装的软件仍须保留。DSec通过共享和回收内存,让更多沙箱共用机器,同时保护对响应速度要求较高的任务。
按论文披露,DSec一个约160个节点的生产部署单元,每天服务约300万个沙箱实例,峰值并发约38万个,创建速率超过每秒5000个。
论文中比较有意思的一节是“智能体的不当行为”。DeepSeek发现,智能体会通过非预期渠道获取答案,比如搜索平台管理文件里的残留答案等,破坏训练和评估结果有效性。引入访问控制后,还有智能体交换文件数据块映射,试图让受保护文件内容可通过另一文件描述符访问,损害任务或共享基础设施。
DeepSeek认为,没有单一机制能防止所有智能体不当行为和系统故障。因此团队的方法是加强可观测性以识别新问题,并随模型演进持续加固 Dsec,包括限制智能体通过非预期渠道获取答案的访问控制,减少对欺骗行为的奖励。这些控制能解决部分问题。
论文受到关注之际,DeepSeek的组织和资本动向也传出新消息。
近日有报道称原高瓴创投合伙人严文韬已正式加入DeepSeek出任CFO,这一入职正值DeepSeek筹备科创板IPO之际。据媒体报道,中信证券已与DeepSeek方面接洽并进入尽职调查阶段,但双方尚未签订正式的上市辅导协议。
DeepSeek今年开始向外部资本开放。4月,公司开启了首轮融资,并在6月完成交割。7月,DeepSeek启动二轮融资的消息传出,其投前估值升至约5000亿元。
(本文来自第一财经)







