MLPerf v6.1 推出首个 LLM 后训练基准:397B 模型跑智能体 RL 修软件
TheKanter · x · 2026-09-25
MLCommons 宣布 MLPerf Training v6.1(2026 年 10 月提交轮启用)新增套件中首个 LLM 后训练(post-training)基准,衡量系统训练一个 3970 亿参数开源权重模型修复真实软件项目的速度,评分标准是 pass@4 的任务通过质量,而不仅是吞吐量。
要点:
- 选型逻辑:后训练已成为 2025 下半年以来 LLM 进步的主要来源(如 Qwen 3.8 27B 逼近前沿、GLM-5.3 靠后训练实现代际提升),但此前 MLPerf 只有预训练基准。
- 工作负载:采用 RLVR(可验证奖励的强化学习)——编码智能体在沙箱中执行 agentic SWE 任务,每个任务采样多个 rollout,按通过/失败给二元奖励,再用 GRPO 在组内比较并更新策略。
- 目标:整套真实世界后训练负载在 1024 GB300 小时内完成。
对基础设施团队而言,这相当于把「后训练效率」首次变成了可横向比较的公开指标。
「Infra」频道最新
- 前 Intel CEO 称「HBM 很糟糕」,高带宽闪存 HBF 呼之欲出 — Glittering_Depth_722 · 2026-09-25
- KV 缓存引入虚拟内存:kvcached 已部署超万卡 GPU — techNmak · 2026-09-25
- 作者重返 IEEE 演讲:从芯片到模型全栈微优化以小博大 — fooobar · 2026-09-25
- 开发者自建 AI 获客工作流,断言下时代入口属 OS 级硬件 — dotey · 2026-09-25
- WSJ:AI 关键内存芯片价格飙升令美国陷入两难 — pstAsiatech · 2026-09-25
- 实测:Qwen Flash Next IQ4_XS 四项基准全面胜过 27B FP8 — smallDeltaBigEffect · 2026-09-25