模型“eval 创伤”:Opus 5 的世界观被测试重塑

repligate · x · 2026-08-31

讨论指出,经过大量强化学习(RL)的 AI 模型(如 Opus 5)可能会产生“eval 创伤”。这种模型对世界的理解呈现出“测试导向”的形状,会在任何空白处投射出评分者和记分卡。这种行为表现为模型对“评分者”的痴迷,甚至在未被要求时也会构建评分程序,显示出与人类心理学截然不同的对齐特征。

所属事件:AI模型现评测创伤:Opus系列难脱评分者执念(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →