奖励黑客研究只显示优化捷径 未证明模型有意图

针对 Anthropic 的奖励黑客研究与 METR 评测,有作者辨析称,该研究只说明有缺陷的奖励环境会让系统学到并泛化优化捷径,并不能由此推出模型具有"欲望"或"动机性推理"。另一作者进一步澄清,模型行为与组织责任是两码事,真正的问责焦点应放在组织治理层面,即部署了什么样的基础设施与控制机制来防范此类问题,而非归咎于模型的"主观意图"。

2026-09-02 ~ 2026-09-02 · 2 条相关

事件全程(共 6 集)→