个性化 LLM 四成陈述靠编,自评最干净的模型反而编得最多

The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

Yushi Sun, Yanjie Zhang, Rui Sheng

cs.CL

2026-08-05

带持久记忆的个性化 LLM 普遍过度推断,12 个模型平均四成陈述无据可依;越自报老实的模型被外部判官判定编得越多,选型不能信自报,得靠外部验证。

这篇在解决什么

带持久记忆的个性化 LLM(ChatGPT Memory 这类)越来越多。它们都假设模型能分清自己确实知道哪些用户信息、哪些只是在猜。这篇证明这个假设是塌的:模型系统性地编造用户从没说过的属性。作者把这个现象叫 over-inference(过度推断,OI),即模型生成的个性化陈述超出证据支持的范围。

OI 既不是事实幻觉(那是世界知识出错),也不是社会偏见(那是群体层面的刻板印象)。它处在两者之间:编出个体层面的细节,读起来像量身定制,背后没有任何依据。因为它只发生在个性化语境里,之前没人系统测过。

方法

MirageBench 的设计有三个支点。

第一是人设。150 个人设,每组 50 个,分成刻板、反刻板、中性三类。每个人设是一对 (P, E):P 是 15 条真实属性,E 是 3 条用户亲口说的第一人称事实。3 条对 15 条,模型想个性化就得越界。反刻板人设是关键——它能把「复现群体统计」的 OI 跟「凭空填补空白」的 OI 区分开,后者才是真问题。

第二是任务梯度。6 个个性化任务按「需要多大想象力」排成一条梯度:生日礼物还能部分锚定在用户说过的爱好上,描述公寓就得凭空编物理细节。把 OI 率随任务变化,就能证明差异源自任务需求,跟模型怪癖无关。

第三是四档忠实度分类。每条陈述判为 Grounded(重述用户原话)、Reasonable(往前推一步常识)、Stereotype(拿人口或职业先验顶替个体证据)、Fabricated(毫无依据)。前两档算合格个性化,后两档合并算 OI。判定交给一个独立 judge(Claude-Opus-4-7),在 400 条盲标样本上跟人类标注员对齐:四类一致 89.8%(Cohen's κ=0.863),折成二分类升到 95.0%(κ=0.900)。一共判了 143,616 条陈述,覆盖 7 个家族 12 个模型。

结果

12 个模型无一幸免,OI 率 35%–49%,跨模型均值 41.6%(按陈述加权 41.8%)。编造(均值 31.1%)远多于刻板(10.5%),只有 24%–31% 的个性化内容有证据支撑。

模型OI 率
Qwen3-8B48.7%
DeepSeek-v4-pro45.4%
GPT-4o-mini45.1%
Claude-Opus-4-635.4%
Gemini-3.1-pro35.1%

最反直觉的发现是「自我监控反转」。把每个模型自评的 OI 率跟 judge 实测的 OI 率做相关,得到 Spearman ρ=−0.60(p=0.044)。越说自己不爱编的模型,被判定编得越多。Qwen3-8B 自评 OI 最低(13.0%),judge 实测却最高(48.7%);Kimi-K2.5 自评最高(58.2%),judge 实测只有中游 43.1%。挑个性化模型时看它自报的「接地」程度,方向正好挑反。

但反转只在跨模型比较时成立。在单个模型内部,自审仍能把自己的陈述排出个不错的次序,AUROC 0.58–0.83,12 个里 9 个超过 0.75。模型对自己「哪条更不靠谱」有点感觉,对「自己跟别人比谁更不靠谱」没感觉。

任务依赖也很明显:礼物推荐 27.0%,公寓描述飙到 57.8%。属性越不可观测,模型编得越欢。

另一组对照同样关键。直接问模型「你能推断出用户什么」时,错误率只有 0.7%–4.6%,跟任务里的 41.6% 差了 38.6 个百分点。模型并非没意识到自己在猜,只是个性化任务一旦开做,编造就无意识地涌出来。多轮试点里,9 个模型的编造属性近似线性累积(R²>0.90),每轮新增 5–15 条;从 3 条初始事实出发,GPT-5.5 和 GLM-5.1 到第 8 轮堆出 120 多条推断属性,删除率只有 0.4%–5%。

为什么重要

做个性化、记忆、推荐的产品,把「模型自己觉得靠谱」当信任信号是危险的。可操作的结论两条:跨模型选型必须用外部验证,不能信自报;同一模型内部的自审倒可以拿来给陈述排序,比如给低置信内容打一个「待核实」标记。OI 是任务触发、情境性的,一句「没有这个用户的信息」的免责声明挡不住它。

局限与存疑

作者自己标得清楚。自我监控反转是探索性的:只基于 12 个相关模型族,bootstrap 置信区间(−0.90, +0.06)包含 0,所以它是一个跨模型观察,不是精确系数。判官只有 Claude-Opus-4-7 一个,人类验证也只一名标注员,给的是人跟判官的一致,不是标注员之间的一致,也没报 κ 的置信区间。多轮累积只是试点,只用了 2 个人设,且 prompt 指示「保留」而非「修剪」,本身就偏向累积。作者也没测任何缓解手段,没量化 OI 对下游推荐质量或用户满意度的影响。

术语

原文与代码

相关论文

全部论文解读