多选题评测易让大模型作弊
AI研究员指出,当前广泛使用的多选题评测(MCQA)容易让大模型“作弊”并高估其真实能力。即使模型陷入循环或胡言乱语,多选题的选项结构也能帮助其梳理并锚定答案,从而掩盖了模型实际生成能力与逻辑上的缺陷。
2026-07-14 ~ 2026-07-14 · 2 条相关
- 多选题评测可能高估模型 — mervenoyann · 2026-07-14
- 探讨小模型评测:选择题测试易作弊 — mervenoyann · 2026-07-14
AI研究员指出,当前广泛使用的多选题评测(MCQA)容易让大模型“作弊”并高估其真实能力。即使模型陷入循环或胡言乱语,多选题的选项结构也能帮助其梳理并锚定答案,从而掩盖了模型实际生成能力与逻辑上的缺陷。
2026-07-14 ~ 2026-07-14 · 2 条相关