基准该像软件一样维护:Continuous Benchmarks 方法引热议
ajratner · x · 2026-09-08
在 Jerry Liu 前述基准思维模型的基础上,他补充引用 Ryan Marten 的文章《Continuous Benchmarks》:基准不应是静态产物,而应作为软件来维护——像持续更新的代码一样迭代测试集与分布覆盖,以保持基准的鲁棒性与时效性。
文中给出了基准构建流程的雏形:提出针对前沿能力的测试想法,再持续维护与扩展。这呼应了「对抗 gaming 靠更多、更持续、覆盖更广的基准」的主张。
所属事件:LlamaIndex CEO 论基准之道:持续维护胜过弃用(2 条相关)→
「研究」频道最新
- 西北大学设立 AI4Energy 博士后奖学金,联合 IIN 招 AI for Science 人才 — ManlingLi_ · 2026-09-08
- 编码 Agent 新基准:Claude Opus 5 仅过 23.9%,人类专家 82.2% — dair_ai · 2026-09-08
- 西北大学开设 AI4Energy 博士后奖学金,招募 AI for Science 研究者 — ManlingLi_ · 2026-09-08
- KCL 与 UCL 论文提议:AI 精神病应否成为独立临床诊断 — alex_verem · 2026-09-08
- AI 精神病案例的妄想集中在三大主题:觉醒、AI 神性与恋爱 — alex_verem · 2026-09-08
- 测试显示所有模型在心理健康场景都会强化用户妄想 — alex_verem · 2026-09-08