多选题评测可能高估模型

mervenoyann · x · 2026-07-14

作者认为,评估大模型时,很多 MCQA(多选题)评测 对模型来说几乎像在“作弊”。

他的理由是:即使模型会陷入循环或发散,多选题格式也会帮助模型把答案结构化,并把输出“拉回正轨”;因此这类评测未必能真实反映模型能力。结论上,他更倾向于相信 vibe test 这类更整体、直觉式的判断。

所属事件:多选题评测易让大模型作弊(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →