15 个被审计 benchmark 作者:评估应视为持续改进过程
sarahcat21 · x · 2026-09-19
Epoch AI 发起的 benchmark 审计计划引发从业者讨论。被审计的 15 个 benchmark 之一的作者 @galyo 发文谈体会:
- 当前「测量与优化」深度绑定,知名 benchmark 实际定义了领域内什么算「进展」,这让用批判眼光重新审视现有 benchmark 的工作极其有价值——他称赞 Epoch AI 启动这项倡议。
- 但作为多年做 frontier evals 的人,他强调:发布一个完美无瑕的 benchmark 几乎不可能。
sarahcat21 转发表示赞同:不应把 benchmark 简单分成好/坏、「有缺陷」/「已验证」二类,审计、发现问题并持续改进才是正确视角。
「研究」频道最新
- Niantic Spatial 推 Gaussian Splat 重打光,为具身 AI 造可变仿真环境 — Scobleizer · 2026-09-19
- 开发者指出:约束解码会悄悄让模型变笨,原理竟如此简单 — narphorium · 2026-09-19
- GRF-Recon 论文:混合稀疏射线场优化破解长序列 3D 重建漂移 — zhenjun_zhao · 2026-09-19
- 看得见记不住:新基准 PersistBench 揭 4D 模型无视觉记忆 — zhenjun_zhao · 2026-09-19
- 单卡跑公里级轨迹:AMB3R-SLAM 误差较前 SOTA 降 70% — zhenjun_zhao · 2026-09-19
- EliGSiR:受限算力下的持续 RGB-D 高斯溅射建图新方法 — zhenjun_zhao · 2026-09-19