只看 pass/fail 分数已无法解读评测:隐藏测试过严致大量误判
trq212 · x · 2026-09-12
作者指出,如今仅凭 benchmark 的 pass/fail 分数已很难解读模型真实能力:他观察到的许多「失败」案例其实源于过于严苛的隐藏测试,有些情况下模型的答案比评测的标准答案更合理。这提示当前 eval 的标注质量与判定规则正在成为噪声来源。
「模型」频道最新
- Arcee 开源 NAC 长任务 agent 框架,实测 DeepSeek 模型 489 次工具调用 — MaziyarPanahi · 2026-09-12
- 蚂蚁 Ling-3.0-flash-VL 评测:5.5B 激活参数上帕累托前沿,幻觉率仅 22% — ArtificialAnlys · 2026-09-12
- 中国开源模型竞争太强,AI 实验室难以像 Uber 那样靠涨价回血 — firasd · 2026-09-12
- 前沿大厂隐私条款暗藏陷阱:点个赞你的对话就可能不被保护 — niloofar_mire · 2026-09-12
- Reddit 网友猜 Astra 隐藏思维链是为防蒸馏而非改进模型 — bfkill · 2026-09-12
- Cursor 推出 CursorBench 4.0,有人据此猜测 Gemini 3.8 后训练路线不同 — ivan_bezdomny · 2026-09-12