AI 让基准爬山更自动化
random_walker · x · 2026-07-16
作者认为,AI 现在越来越能自己完成 benchmark 上的“爬山式”优化,这会释放人类研究者的时间,让他们更专注于那些需要判断、难以验证的部分。
但这也会让同行评审和评测体系更脆弱:当 benchmark 表现不再是有效过滤器时,现有审稿和评估机制会进一步失效。帖子最后指向一篇相关论文,讨论 peer review 和其他评估实践应如何调整。
「研究」频道最新
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11
- Apodex 发布 TRACES 标准:用 423 个真实问题评测"发现型 AI" — Faheem_uh · 2026-09-11
- 科学没有标准答案:TRACES 用六维度评估 AI 过程而非结果 — Faheem_uh · 2026-09-11
- Apodex 推出 TRACES 基准:不打标准答案,专测 AI 探索未知的能力 — Faheem_uh · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11