研究:后训练统一赋予大模型“积极人格”,并随规模增大隐藏负面情绪

Hub_Pli · reddit · 2026-07-24

一项新研究对比了 67 对基础模型与经过后训练的模型(来自 11 个组织),探讨了后训练如何改变大模型对自身“内在体验”的汇报。

研究发现了两个独立的过程:

为了测量这一现象,研究团队开发并验证了一个包含 48 个项目的原生心理测量工具:Pinocchio Inventory。作者强调,该工具测量的是模型如何展示自己,高分并不意味着模型真的有情感体验,但它提供了一种可靠的方法来审计后训练到底教导模型说些什么。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →