Codex 把玩笑提示词写成了评测 benchmark 生成器的论文
emollick · x · 2026-07-24
- 这条原本是个玩笑:作者让 Codex 去“构建 BenchBench、再推导 BenchBenchBench,并把它写成 arXiv 论文”,结果真的生成了一篇 PDF。
- 但论文内容并不只是梗,而是在讨论benchmark 生成器的元评测:用一个“holdout audit”检查给 benchmark 打分的规则,是否真的能选出高质量 benchmark。
- 论文给出的实验里,完整评测器在复合目标上达到 Spearman ρ = 0.945、pairwise accuracy 90.8%;但在隐藏质量目标上只剩 ρ = 0.580、73.3%。
- 核心结论是:可见分数和真实选择质量可能严重不一致,benchmark 作者应披露公开分数与验证目标之间的重叠关系。
「研究」频道最新
- S-Agent 用行动链做空间推理,MMSI-Bench 零样本达 46.4% — 机器之心 · 2026-07-24
- 若 LLM 只会解存在性问题,数学界或仍难大变 — JFPuget · 2026-07-24
- 一种新思路把微调权重与基座模型差分可视化 — DominiqueCAPaul · 2026-07-24
- AI 周刊第 465 期:Kimi K3、Opik 诊断与新论文 — dl_weekly · 2026-07-24
- Airbnb CTO 反驳了围绕模型蒸馏的常见误区 — stanfordnlp · 2026-07-24
- Aristotle system 成功形式化一篇论文,证明工具进入实战 — Singularitarian · 2026-07-24