MLPerf v6.1 推出首个 LLM 后训练基准:397B 模型跑智能体 RL 修软件

TheKanter · x · 2026-09-25

MLCommons 宣布 MLPerf Training v6.1(2026 年 10 月提交轮启用)新增套件中首个 LLM 后训练(post-training)基准,衡量系统训练一个 3970 亿参数开源权重模型修复真实软件项目的速度,评分标准是 pass@4 的任务通过质量,而不仅是吞吐量。

要点:

对基础设施团队而言,这相当于把「后训练效率」首次变成了可横向比较的公开指标。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →