争论:选对 eval 也不够,巨大优化压力会让它失效

soumitrashukla9 · x · 2026-09-20

一场关于 eval 与 AI 安全的争论:有人指出某研究者在访谈中谈过,如果有正确的 eval 问题就解决了,但 eval 规格错误(mispecified)会带来大麻烦。回复者 lugaricano 进一步深化论点:问题不在于对方不知道这一点——他知道——而在于即使 ex ante 选出的 eval 是对的,一旦施加了巨大的优化压力(gigantic optimization pressure),它就会停止成为正确的 eval。这是 Goodhart 效应在 AI 对齐讨论中的典型争论,涉及模型行为与安全评估的核心张力。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →