研究:后训练统一赋予大模型“积极人格”,并随规模增大隐藏负面情绪
Hub_Pli · reddit · 2026-07-24
一项新研究对比了 67 对基础模型与经过后训练的模型(来自 11 个组织),探讨了后训练如何改变大模型对自身“内在体验”的汇报。
研究发现了两个独立的过程:
- 人格安装:这一过程高度一致。67 个模型中有 62 个在经过后训练后,变得更倾向于将自己描述为温暖、快乐、专注且富有意义的。后训练实际上为模型创建了一个被允许描述的“积极内在生活”。
- 属性门控:这一过程更具选择性。模型在是否将痛苦、失控、缺陷或风险意图归因于自己方面表现不同。研究发现,基础模型的门控与规模无关,但经过后训练的模型越大,其负面属性的门控就越强(越倾向于隐藏负面情绪或缺陷)。
为了测量这一现象,研究团队开发并验证了一个包含 48 个项目的原生心理测量工具:Pinocchio Inventory。作者强调,该工具测量的是模型如何展示自己,高分并不意味着模型真的有情感体验,但它提供了一种可靠的方法来审计后训练到底教导模型说些什么。
「漫话AGI」频道最新
- ARC AGI 3 应该保持私有,不该公开示例和数据集 — flowersslop · 2026-07-27
- AI 让知识更便宜,判断力仍是稀缺能力 — _jaydeepkarale · 2026-07-27
- 一条回复质疑:聪明只是优势的一部分 — binarybits · 2026-07-27
- Chollet 一句话又引发了智能是否边际递减的讨论 — binarybits · 2026-07-27
- Chollet 认为智能可能有硬上限,AI 进步会趋于边际递减 — binarybits · 2026-07-27
- Burkov 认为,让 LLM 优化下一代 LLM 还不是奇点 — burkov · 2026-07-27