AI 安全圈的“伪关怀”?批评者指责同行只说不做

davidmanheim · x · 2026-08-30

在关于解决 AI 对齐中指标优化问题的争论中,David Manheim 激烈反驳,指出“支持安全”的人群往往在有人真正尝试解决问题时感到愤怒,暗示他们更享受说教而非寻求方案。他再次引用论文《Categorizing Variants of Goodhart's Law》来佐证这类指标黑客行为为何长期无法奏效。

所属事件:AI 安全研究者激辩古德哈特定律与 LLM 对齐难题(4 条相关)→

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →