论文探究:模型在角色扮演时是否信以为真
alex_verem · x · 2026-08-22
研究问题
当模型被要求扮演亚里士多德并主张“地心说”时,这仅仅是改变了其输出行为,还是改变了其内部对真理的表征?
实验方法
研究通过让模型扮演与现代共识不符的角色,测试不同诱导方法下的信念内化程度:
- 方法:Prompting、In-context Learning (ICL)、Supervised Fine-tuning (SFT)、Open Character Training (OCT)、Emergent Misalignment (EM)。
- 测量:使用 Truth Probes(真相探针)和行为测试来衡量内部表征的变化。
主要发现
- 表层变化:Prompting、ICL 和 SFT 主要改变模型“说什么”,对内部表征影响极小。
- 深层改变:EM 导致了模型真理表征的广泛而巨大的偏移;OCT 在较大模型上引发了较小的清晰偏移。
意义
理解训练何时会改变模型的“世界观”而非仅仅是行为,对于未来赋予 AI 系统更大自主权和影响力至关重要。
「研究」频道最新
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24
- Google 自动化科研系统发现 66 个生物标志物 — imjustnewatai · 2026-08-24