AI 研究者:不给训练数据的基准测试完全毫无意义
mjdramstead · x · 2026-09-09
研究者 Michael Dramstead 发文提醒:如果基准测试不公开其训练数据,那么结果就「绝对、完全、100% 无意义」,并呼吁学界停止装傻。这一观点直指当前模型评测中训练/测试数据不透明导致的成绩不可比、易污染问题。
「模型」频道最新
- APEX-Agents 1.1 更新基准:Claude Fable 5.1 以 68.6% 居首 — amaarora · 2026-09-09
- 评论:前沿模型订阅必然「缩水通胀」,逼你升级到 API 付费 — StewartalsopIII · 2026-09-09
- 用户实测:高峰定价翻倍后,252M 缓存 token 一天只花 $0.75 — teortaxesTex · 2026-09-09
- 实测对比:Astra 长线程表现明显逊于 Sol,易跑偏失稳 — jdjohnson · 2026-09-09
- VC communism 时代落幕,前沿模型开始配给制,VC 求选模型心法 — StewartalsopIII · 2026-09-09
- "数据标注已死"遭质疑:cherry-pick 演示≠长尾能力 — chris_j_paxton · 2026-09-09