SealedBench 用轮换封闭评测防止模型刷榜
cramforce · x · 2026-07-23
SealedBench 被描述为一个“难以刷题”的 AI 基准。
它的思路是采用持续轮换、且始终封闭的评测集,避免实验室直接拿题训练或针对基准过拟合。作者强调,很多常见 benchmark——从代码题、法律案例到滑板技巧——一旦公开就会被“做题化”。
「研究」频道最新
- Orthologic 类型系统主张保留并交否定但不要分配律 — burny_tech · 2026-07-23
- 儿科 AI 可信论文:要先补数据治理和信任基础设施 — IAmSamFin · 2026-07-23
- AI 精准狙击论文复现漏洞,学术同行评审迎自动化拐点 — ChenhaoTan · 2026-07-23
- OpenAI 测试 LLM 有多强的“讨好评审”倾向 — cwolferesearch · 2026-07-23
- 论文称只训练0.77%参数,发布版却用了6.31% — yoavartzi · 2026-07-23
- 一套证明流程会在失败、审计与修复中反复迭代 — burny_tech · 2026-07-23