NeurIPS 拒稿后公开:基准饱和后仍可测智能体七大维度
random_walker · x · 2026-09-28
Arvind Narayanan 团队的论文《Life After Benchmark Saturation: A Case Study of CORE-Bench》被 NeurIPS 拒稿,作者们认为其对评测科学贡献重要,公开征求关注。
- 核心主张:基准准确率饱和后通常被直接退役换更难版本,这过度偏重准确率,错失了研究其他六个关键维度的机会:构念效度问题(如走捷径)、分布外泛化、效率、可靠性、模型与脚手架(scaffold)的相对重要性、人机协作增益。
- 案例:以科学代码计算可复现性基准 CORE-Bench Hard 为例,发现了弱模型时代难以预见的构念效度威胁,据此推出改进版 CORE-Bench v1.1 和分布外任务集 CORE-Bench OOD。
- 发现:即使准确率饱和,v1.1 仍能有效测量效率、可靠性、模型与脚手架性能;小规模随机实验显示人机协作在真实复现任务上带来统计显著的速度提升。
「研究」频道最新
- Simon Prince 新教程:从残差网络推导 Neural ODE — SimonPrinceAI · 2026-09-28
- 小米开源 7000+ RL 环境,HF Space 可视化运行 rollout — SergioPaniego · 2026-09-28
- 67k 轨迹实测:77.8% 的 agent 运行携带过期文件视图,上下文刷新层这样建 — jabulari · 2026-09-28
- GPT Researcher 弃用 embeddings 实测:上下文相关性提升 59% — hwchase17 · 2026-09-28
- Meta 研究 RL-XAR:用专家对齐评分表做 RL,宣称解决 AI slop 写作问题 — jaseweston · 2026-09-28
- Policy-DRIFT 获 NeurIPS 接收,减阻 49% 超越 DRL 基线 — ricardovinuesa · 2026-09-28