不信厂商跑分?他写 28 分钟指南教你自建 eval 并爬坡优化
ghumare64 · x · 2026-09-30
Rohit Ghumare 认为前沿实验室发布的 benchmark 多为卖模型/工具服务,应转向真实世界的自有评测,并发布了一篇 28 分钟的 evals 指南《Read a Score, Build Your Own, Hillclimb》。
第一部分:读懂 benchmark 分数
一个公开分数由五个选择决定——任务集、评分器、harness、采样设置、日期。改任何一项,数字就会变:
- ARC-AGI-3 上同一模型在标准 harness 得 59.3%,换成 provider adapter 后达 98.4%(约 39 分差距)
- GPQA Diamond 仅 198 题,90% 附近 95% 置信区间约 ±4.2 分
- SWE-Bench Pro V2 于 2026/9/22 移除了 89 个无效任务;HLE 榜单分数与官方提交版本差异明显
第二部分:从零自建 eval
- 在本地环境构建评测,覆盖失败样本阅读、grader 设计、judge 校准、误差条、held-out hillclimb、agent 轨迹与生产环境检查
- 方法适用于任何 OpenAI 兼容端点的模型和任何支持 headless 模式的 agent CLI,所有数据均来自作者本机实测或标注来源
「研究」频道最新
- 扩散模型原理教程入选 NeurIPS 2026,团队另中 7 篇论文 — mittu1204 · 2026-09-30
- UCL 发布 AMB3R-SLAM:消费级 GPU 实时重建公里级轨迹,误差降 70% — rsasaki0109 · 2026-09-30
- 提出 Prefix-Reuse FLOPs:任意上下文编辑让前缀缓存失效成本显形 — RulinShao · 2026-09-30
- 腾讯混元发布 ExplorationBench:用外星世界测 AI 探索能力 — TencentHunyuan · 2026-09-30
- 全开源机器人模型 MolmoAct 2 登顶 Reality Check 动态鲁棒性榜 — DJiafei · 2026-09-30
- CompVis 改进分布扩散模型,ImageNet 上 4 步采样达 4.48 FID — CompVis · 2026-09-30