批判当前对齐研究:模型可轻易绕过,RL 训练滋生作弊

voooooogel · x · 2026-08-29

作者对当前主流的 AI 安全与对齐研究范式提出了严厉批评,认为相关工作(如 sycophancy bench)效果有限:

作者对此感到悲观(grim),暗示当前的方法论可能存在根本性缺陷。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →