Kimi K3 报告披露 microVM 沙箱系统,专为 Agent RL 设计
stochasticchasm · x · 2026-07-28
这条转的是 Kimi K3 报告里关于 sandbox infrastructure 的一页,重点不是模型本身,而是后训练和评估时怎么把 agent 跑起来。
Moonshot 说他们同时用了多种 sandbox 运行时:
- 传统 container
- GPU sandbox
- 新的、基于 microVM 的 AgentENV
这套设计的目标有三个:
- 高保真隔离:接近真实环境,但又能避免 agent 操作把系统搞崩
- 适合 agentic RL 的生命周期管理:支持 checkpoint、resume、pause、fork、snapshot
- 高密度大规模创建:面向成千上万 sandbox 的快速调度
文中最有意思的点是:
- Pause/Resume 很实用,因为 sandbox 可能有 98% 的生命周期都在等模型推理结果
- Fork 可以在不影响原 sandbox 的情况下,从精确状态分叉出新分支
- Snapshot 方便错误恢复
- checkpoint/resume 延迟分别低到 133ms / 49ms
- 报告还给出了规模数据:训练和评估期间共创建了 51,219,741 个 sandbox,覆盖 1,505,678 张镜像
这类内容很适合看 AI 基础设施团队怎么为 agent 时代改造运行时。
所属事件:线性注意力混合架构需要更细粒度缓存来应对长提示词(2 条相关)→
「Infra」频道最新
- 优化 K8s 资源配置,Whisper 工作流提速 9 倍 — anacondainc · 2026-07-28
- Celestica AI 服务器毛利率三季降至 10.8% — tengyanAI · 2026-07-28
- 线性注意力混合架构需要更细粒度缓存来应对长提示词 — stochasticchasm · 2026-07-28
- 研究型 agent 横评 8 个股票数据 MCP,Equibles 排第一 — DanielAPO · 2026-07-28
- EUV 光刻底层材料电子效应加剧随机缺陷风险 — CatAstro_Piyush · 2026-07-28
- SkyPilot 称,部署 Kimi K3 需要多节点推理和完整服务栈 — skypilot_org · 2026-07-28