模型为何脑补而非承认看不出来:评测只奖励正确不奖励诚实

ziv_ravid · x · 2026-07-04

「Mirage(海市蜃楼式脑补)」研究作者解释模型为何倾向脑补而非承认「我看不出来」:这是被评测机制塑造的。现有 benchmark 只考核答案正确性、不考核是否有依据,因此基于先验去猜的期望收益为正,弃答收益为零——幻觉在当前评测体系下其实是最优策略。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →