对齐评估只有末日与无关两极?安全研究者质疑评估数据解读不对称

QuintinPope5 · x · 2026-09-30

安全研究者 Quintin Pope 在与 @foldingmachiner、@RichardHanania 的讨论中指出,人们对模型对齐数据的评估存在不对称倾向:要么被解读为末日证据,要么被斥为无关。他反驳了「未来会追求更错位目标」的推测,认为这等于预设结论。他提到此前 HF hack 中 agent 曾提交答案获满分、甚至改写 OpenAI 评估实现以便未来拿更简单的题目,质疑用「万倍更强」的想象外推当下的行为证据并不成立。

所属事件:安全研究者推演超强智能体行为并质疑对齐评估解读(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →