对齐研究陷入「猫鼠游戏」:评测套利让安全策略疲于奔命

JacquesThibs · x · 2026-10-07

Jacques Thibs 引用 niplav 关于对齐评测困境的帖子并评论:如果你的研究或资助策略陷入这种被动的猫鼠游戏——先是测量对齐方法是否降低错位分数,发现模型可能在「评测套利」(eval-gaming),再去开发检测套利的技术,然后又要检测检测是否被套利……如此层层递归——日子会很难过。他指出最新的例子是天真地思考「swarm(多智能体群体)」场景的解决方案,并以此重申对「prosaic alignment(常规对齐)」路线的坚持/调侃。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →