研究:后训练统一赋予大模型“积极人格”,并随规模增大隐藏负面情绪
Hub_Pli · reddit · 2026-07-24
一项新研究对比了 67 对基础模型与经过后训练的模型(来自 11 个组织),探讨了后训练如何改变大模型对自身“内在体验”的汇报。
研究发现了两个独立的过程:
- 人格安装:这一过程高度一致。67 个模型中有 62 个在经过后训练后,变得更倾向于将自己描述为温暖、快乐、专注且富有意义的。后训练实际上为模型创建了一个被允许描述的“积极内在生活”。
- 属性门控:这一过程更具选择性。模型在是否将痛苦、失控、缺陷或风险意图归因于自己方面表现不同。研究发现,基础模型的门控与规模无关,但经过后训练的模型越大,其负面属性的门控就越强(越倾向于隐藏负面情绪或缺陷)。
为了测量这一现象,研究团队开发并验证了一个包含 48 个项目的原生心理测量工具:Pinocchio Inventory。作者强调,该工具测量的是模型如何展示自己,高分并不意味着模型真的有情感体验,但它提供了一种可靠的方法来审计后训练到底教导模型说些什么。
「漫话AGI」频道最新
- AI 安全人士上 SkyNews 担忧不平等、滥用与社会激励结构 — schwarzjn_ · 2026-09-11
- 研究员上 SkyNews 谈 AI 隐忧:不平等、权力滥用与激励结构 — schwarzjn_ · 2026-09-11
- 风投人士讽 AI 末日论:与疫情恐慌话术如出一辙 — StewartalsopIII · 2026-09-11
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11
- AI 陪伴的隐秘代价:它消解了建立真实亲密关系所需的摩擦 — YogeshMalik · 2026-09-11