博主炮轰私有评测集:要么全开源要么一句话带过
xeophon · x · 2026-09-19
作者提出一个评测设计主张:只应存在两类 eval——完全开源、可被社区审计的评测,和仅配一句话描述的完全封闭评测。理由是私有 held-out 测试集既给不了模型整体质量的信号,又允许厂商沿用与开源评测相同的合成数据管道来针对性优化,让闭源评测失去意义。
「研究」频道最新
- JevBench 首测:242 项决策对比九个模型,准确率最高 97.1% — airesearch12 · 2026-09-19
- YiFang Zhang 发布 FlashREINFORCE,称前沿 RL 配方已被揭开 — CatAstro_Piyush · 2026-09-19
- 当 AI 攻陷数学竞赛:数学界反思「只会证明不会理解」的文化 — danbri · 2026-09-19
- CMU 自主科学实验室将亮相 Enamine 药物发现会议 — olexandr · 2026-09-19
- AI 与科学专题登 Scientific American,作者转发媒体好评 — JMateosGarcia · 2026-09-19
- 陶哲轩发文:数学不止于证明,其余贡献同样值得颂扬 — num42 · 2026-09-19