Quintin Pope 引 Ngo-Yudkowsky 对话:SGD 为何会从安全域学出危险搜索

QuintinPope5 · x · 2026-10-08

可解释性研究者 Quintin Pope 在辩论中引用 MIRI 整理的 Richard Ngo 与 Eliezer Yudkowsky 关于对齐难度的 Discord 对话实录(2021 年首发的系列转录,参与者还包括 Ajeya Cotra、Paul Christiano、Carl Shulman 等)。关键点:当被问及「为什么为窄能力训练的 SGD 模型会产生通用能力」时,Yudkowsky 的回答是优化过程本身倾向于从「安全」领域中学出危险的搜索行为——Pope 引用此段来支持自己关于 Yudkowsky 误判单个 SGD 系统内能力纠缠的论点。

所属事件:可解释性研究者激辩 SGD 能否从安全域学出危险搜索(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →