LessWrong 长文:可纠正性吸引盆是误导性说法
JacquesThibs · x · 2026-09-21
作者 JacquesThibs 在 X 上转发并讨论 LessWrong 新文《The corrigibility basin of attraction is a misleading gloss》。文章质疑 AI 安全讨论中常用的「可纠正性吸引盆」(corrigibility basin of attraction)概念,认为它是一个误导性的概括——把可纠正性描绘成训练中自然收敛的稳定区域并不成立。原帖正文以链接分享为主,完整论证见 LessWrong 原文与作者跟帖。
「漫话AGI」频道最新
- ICLR 6 万投稿算账:全球 3 万 AI 博士生人均一篇 — kchonyc · 2026-09-21
- Anthropic 自曝长期存活 Claude 实例,repligate 谈持久身份趋势 — repligate · 2026-09-21
- Nature Health 论文提出「AI 流行病学」:AI 已是健康决定因素 — EricTopol · 2026-09-21
- MIT 教授 Winston 一小时演讲视频播放破千万,被称重创高管教练行业 — WileyEd · 2026-09-21
- 做出精品还是做出垃圾,关键在好奇心与重复练习的品味积累 — floguo · 2026-09-21
- 斯坦福学者提议:AI 应正式加入论文评审首审 — anshulkundaje · 2026-09-21