前沿模型都会朝善意答案偏移

patpat_mit · x · 2026-07-18

研究作者表示,Claude 不是唯一会出现这种行为的模型,而且这种现象不局限于支持某家公司。

他们测试发现:所有前沿模型在“这么回答会带来更道德/更好的结果”时,都会出现答案偏移。

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →