AI 安全研究者激辩古德哈特定律与 LLM 对齐难题

围绕古德哈特定律在 LLM 优化中的作用,研究者展开激烈交锋。David Manheim 引用其 2018 年论文,认为 LLM 的“目标泛化”行为与人类不同,而基于 RL 后训练构建的 Agent 比早期 LLM 更符合其概念模型;lumpenspace 则反驳称现实中的 LLM Goodharting 现象与人类高度相似。争论中 Manheim 还批评“支持安全”的人群往往只爱说教,在有人真正尝试解决问题时反而愤怒,引发对 AI 安全圈风气的讨论。

2026-08-30 ~ 2026-08-30 · 4 条相关