研究者吐槽:评测代码里大量函数只为修数据集而存在
remilouf · x · 2026-10-11
开发者 remilouf 统计自己多个 eval harness 里的函数,发现相当一部分的唯一作用是修补数据集本身的问题。他感叹这对整个 eval 领域的状态来说不是好信号——评测基础设施的复杂度被数据质量问题大量消耗。
「研究」频道最新
- JevBench 作者解释:为何开源与 API 模型分设两张排行榜 — airesearch12 · 2026-10-11
- 哈佛医学院 ToolUniverse 工作坊:给 AI 配 2700 个科学工具造 AI 科学家 — marinkazitnik · 2026-10-11
- Mark Tenenholtz:RLVR 易得红利枯竭,「品味」类任务成下一前沿 — marktenenholtz · 2026-10-11
- ToolUniverse 集成 2900+ 科研工具,助 AI Agent 跑蛋白质设计 — marinkazitnik · 2026-10-11
- 把《致爱丽丝》映射成马尔科夫链:音乐与数学之美的可听化 — solyarisoftware · 2026-10-11
- Bo Wang出席SF Tech Week医药AI论坛,热议虚拟细胞与AI药物 — BoWang87 · 2026-10-11