论文研究:模型角色扮演时是否真的相信所说
kastnerkyle · x · 2026-08-27
一项新研究探讨了语言模型在角色扮演时的内部信念状态。研究者让模型扮演历史人物(其已知观点与现代共识相悖),并通过探针测量模型内部的「真值」表示是否与其(历史上正确但事实错误的)陈述相匹配。
研究发现不同诱导方法(提示、上下文学习 ICL、监督微调 SFT、开放角色训练 OCT、突发性失对齐 EM)会导致不同程度的信念内化:Prompting、ICL 和 SFT 主要改变模型输出而较少改变内部表示;EM 会导致模型真值表示发生广泛而剧烈的偏移;OCT 也会造成偏移,在大模型上更为明显。
「研究」频道最新
- EgoSuite 数据集可视化浏览器工具开源 — jonstephens85 · 2026-08-27
- Lightwheel 开源 10 万小时 Physical AI 第一人称数据集 — jonstephens85 · 2026-08-27
- 新研究:最强模型不等于最佳辅助,自动化能力难预测协作效果 — soumitrashukla9 · 2026-08-27
- 科学家研发模仿运动的植入物,可抗衰老并增强体能 — Dr_Singularity · 2026-08-27
- 研究称 Agent 完全自主比预设管架更擅长数学发现 — rohanpaul_ai · 2026-08-27
- BixBench3 评测:OpenAI 领跑,AI 复现论文成功率达 48% — anshulkundaje · 2026-08-27