Quintin Pope 引 Ngo-Yudkowsky 对话:SGD 为何会从安全域学出危险搜索
QuintinPope5 · x · 2026-10-08
可解释性研究者 Quintin Pope 在辩论中引用 MIRI 整理的 Richard Ngo 与 Eliezer Yudkowsky 关于对齐难度的 Discord 对话实录(2021 年首发的系列转录,参与者还包括 Ajeya Cotra、Paul Christiano、Carl Shulman 等)。关键点:当被问及「为什么为窄能力训练的 SGD 模型会产生通用能力」时,Yudkowsky 的回答是优化过程本身倾向于从「安全」领域中学出危险的搜索行为——Pope 引用此段来支持自己关于 Yudkowsky 误判单个 SGD 系统内能力纠缠的论点。
所属事件:可解释性研究者激辩 SGD 能否从安全域学出危险搜索(2 条相关)→
「漫话AGI」频道最新
- AI 圈争论:AI 找到的漏洞是否都在「凸包」之内 — QuintinPope5 · 2026-10-08
- 开发者指出 vibe coding 如买书不读:15 分钟出 PoC 后即弃 — MarcJSchmidt · 2026-10-08
- 肯尼亚难民营里的 AI 零工:干着 AI 外包活,报酬无保障 — nordicinst · 2026-10-08
- 有开发者断言:应用层将在两年内消失 — _AustinCalvert_ · 2026-10-08
- 5 年区块链讲师断言:别学编程了,去学 Vibe Coding — mfckr_eth · 2026-10-08
- 引 DeepMind 论者观点:FDE 大多在自动化注定过时的企业流程 — _AustinCalvert_ · 2026-10-08