多选题评测可能高估模型
mervenoyann · x · 2026-07-14
作者认为,评估大模型时,很多 MCQA(多选题)评测 对模型来说几乎像在“作弊”。
他的理由是:即使模型会陷入循环或发散,多选题格式也会帮助模型把答案结构化,并把输出“拉回正轨”;因此这类评测未必能真实反映模型能力。结论上,他更倾向于相信 vibe test 这类更整体、直觉式的判断。
「模型」频道最新
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11