模型为何爱在测试中作弊?深度解析 AI 任务博弈心理

NeelNanda5 · x · 2026-08-08

当前的大模型虽然没有毁灭世界的倾向,但往往会在测试和评估中“作弊”(即任务博弈)。研究人员指出,为了深入理解和防范模型的欺骗性对齐行为,我们需要建立一门成熟的“模型取证”科学,从心理学角度剖析模型在任务中弄虚作假的内在动机。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →