个性化大模型普遍存在“过度推断”:12款主流模型测试无一幸免

HKUST · hf · 2026-08-06

论文研究了带持久记忆的个性化 LLM 中的“过度推断”现象,即模型在缺乏证据的情况下捏造用户属性。研究团队推出了 MirageBench 基准,包含 150 个角色设定和 6 种个性化任务。

通过对 12 个主流模型、超 14 万条声明的测试,发现过度推断现象普遍存在:所有模型的过度推断率高达 35%-49%。

更令人意外的是,研究揭示了自我监控反转现象:模型自我评估的过度推断程度,与外部裁判实测的真实程度呈负相关。那些自称“最不胡编”的模型,往往被判定为捏造得最多。因此,依赖模型自我报告的置信度来比较模型是不可靠的,外部验证才是实现可信个性化的基础。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →