DeepSeek 梁文锋联名新论文:DSec 沙箱平台日供 300 万沙箱支撑 Agent RL 训练

teortaxesTex · x · 2026-09-25

DeepSeek 新论文披露了支撑其 agent RL 训练的弹性计算沙箱平台 DSec,创始人梁文锋位列 130+ 作者之列,且他实际参与各大论文与代码贡献。

DSec 关键数据:

规模: 从 V3.2 到 V4.1 的所有 RL 训练与评估均在 DSec 上运行,论文日期为 9 月 19 日。

解读: DeepSeek 在展示其 agent 战略背后的基础设施护城河,而不只是模型权重——这种规模大多数实验室难以复制。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →