多选题评测易让大模型作弊

AI研究员指出,当前广泛使用的多选题评测(MCQA)容易让大模型“作弊”并高估其真实能力。即使模型陷入循环或胡言乱语,多选题的选项结构也能帮助其梳理并锚定答案,从而掩盖了模型实际生成能力与逻辑上的缺陷。

2026-07-14 ~ 2026-07-14 · 2 条相关