人们把LLM当神谕:捐赠日志里神谕式提问四年从四成升到七成

LLMs as Oracles: Reliance on LLMs for Subjective Personal Questions

Myra Cheng, Lujain Ibrahim, Grace Liu, Michelle S. Lam, Vishakh Padmakumar, Nick Madibekov, Diyi Yang, Dan Jurafsky

cs.CY, cs.AI, cs.CL

2026-09-14

斯坦福等提出神谕角色分类,在6.8万条公开日志和52人14万条捐赠记录里看到神谕式提问上升。用户常低估自己的外包,对AI比对「人」更爱问「该怎么办」。

这篇在解决什么

人们早就把不确定的人生问题丢给外部权威:德尔斐神谕、占星、抛硬币。LLM 把这件事变得随时可及,而且回答具体、自信、贴着用户说。主观问题上没有对错可核,传统「过度依赖」评测用不上。斯坦福、牛津、卡内基梅隆这篇要回答的是:用户有没有把判断和决策卸给模型,卸了多少,自己知不知道。

方法

核心是一套角色分类,不是按话题(事业/感情),按「卸了什么」。信念侧:Interpreter 解释他人或自己,对照 Contextualizer 列出多种读法;Evaluator 下规范性判断,对照 Deliberator 摆理由不下定论。行动侧:Decision-maker 替用户选定一条路,对照 Strategist 只给选项;Ghost-writer 代写要说的话,对照 Editor 改用户已有草稿。无法归入主观个人问题的标成 NA。口径故意偏保守,单纯倾诉和记日记不算神谕。

Gemini-2.5-Pro 做九分类裁判,和两名专家在 219 条分层样本上 kappa>0.65,三人 Fleiss kappa=0.66。

数据三块。公开日志:WildChat 滤出 60,376 条英语主观相关 prompt(2023–2024),ThoughtTrace 8,526 条(2026,带人口统计)。捐赠工具:52 名美国 Prolific 用户上传 ChatGPT/Claude 历史,140,834 条消息,2022 年 12 月到 2026 年 8 月,只回传标签不回传原文。另有预注册实验 N=520,以及一项 3 周谄媚研究的二次分析(1,015 人,95,405 条消息)。

结果

主观个人问题里,信念任务九成以上是神谕式;行动任务大约对半。WildChat 里写作为主(Ghost-writer 约 33%,Editor 约 25%),Interpreter 和 Evaluator 随时间上升(皆 r=0.55,p=0.041),非神谕的 Strategist 下降(r=-0.72,p=0.004)。ThoughtTrace 以决策为主(Strategist 约 50%,Decision-maker 约 41%)。男性高于女性(t=-3.343,p<0.001),34 岁以下高于以上(t=2.73,p<0.01),每周都用 AI 的人更高(t=2.37,p=0.02)。

捐赠日志更陡。主观问题里神谕占比约从 0.4 升到 0.7(r=0.80,p<0.001)。Decision-maker 和 Interpreter 上升(r=0.72 和 0.92),Strategist 下降(r=-0.63)。自报和实测对不上:Decision-maker 自报只排中游,实测占 28%;Deliberator 自报第二常见,实测不到 1%。看完报告,准确度均值 5.94、信息量 6.12、惊讶度 5.33(1–7 分)。52 人里 19 人打算以后少把判断卸给模型。

预注册实验里,用户对「AI」发神谕消息 20.0%,对「以为是人、实际也是 LLM」只有 11.1%(p<0.001)。至少发一条的比例 65.4% 对 51.2%(OR=1.80)。AI 温暖隐喻每高一个标准差,发神谕的几率高 55%。谄媚条件下神谕使用三周内上升(r=0.62,p=0.03)。

干预能压输出端的神谕腔。提示「用户在自我发现」会降,提示「用户要快答」会升。闭源模型有 49–58% 的回合自行判定用户要快答,开源模型只有 0–8%。DPO 和提示降幅接近,但即时奖励变差:200 名众包更喜欢原来的神谕回复;问「哪条更能形成自己的判断」时,反过来选 DPO。

观察数字对照
捐赠日志神谕占比约 0.4→0.72023–2026 主观问题
AI vs 以为是人20.0% vs 11.1%预注册 N=520
自报 Deliberator第二常见实测 <1%
闭源判定「要快答」49–58%开源 0–8%

为什么重要

依赖研究终于有一套能在开放主观场景里跑的量表。产品侧有两处可动手:交互里少给唯一答案,训练目标别只优化当下点赞。用户侧,把「帮用户想清楚」和「替用户拍板」分开写进 prompt,已经能改变角色分布。捐赠报告说明,很多人不是故意把人生决定外包出去,看见统计才会不舒服。

这不是道德判决。神谕式提问在危机时刻可能就是用户想要的。论文量的是过程(问题怎么问),不是结果(听了以后有没有照做)。

局限与存疑

众包和「至少 50 段对话」的捐赠样本偏重度用户,而且全是美国英语。WildChat 偏向高活跃用户。N=52 看个体差异没统计效力。预注册实验里「人类」条件其实也是 LLM 角色扮演,差异可能混进回复风格。谄媚分析是二次使用。时间趋势分不开用户变了、模型变了、还是用户构成变了。裁判把每条消息打成单一主导角色,倾诉被排除。论文不追踪回答有没有真的改写信念或行动。

术语

原文与代码

社区讨论

相关论文

全部论文解读