探讨小模型评测:选择题测试易作弊

mervenoyann · x · 2026-07-14

AI 研究员 Merve Noyant 指出,在评估大模型时,多数多选题评测(MCQA)实际上容易让模型“作弊”:即使模型陷入循环或胡言乱语,多选题的选项结构也能帮助其梳理并锚定答案。因此她更倾向于喜欢研究小模型,并强调进行“氛围测试”(vibe test)的重要性。

所属事件:多选题评测易让大模型作弊(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →