对齐研究员 ArthurConmy:不减速的话 p(doom)>0.1
ArthurConmy · x · 2026-09-23
可解释性/对齐研究员 ArthurConmy 参与对齐话题讨论,表示如果没有整体减速或暂停,p(doom)大于 0.1。他并不认为需要"完美对齐",但担心稀有输入下模型行为极度失控的失败模式——未来的模型一旦出现这类情况可能造成巨大破坏。
他补充:对齐领域其实已有大量"即插即用"的待办任务,但难点在于无法预测并阻止所有可能的失败方式,这正是对齐进度慢于能力进展的核心原因。
所属事件:对齐研究员:不减速 AI,灭绝风险超 10%(2 条相关)→
「漫话AGI」频道最新
- 「减速论过时了」:新模型密集发布,曲线加速向上 — Dr_Singularity · 2026-09-23
- Palantir 联创 Joe Lonsdale:AI 繁荣延续,2030 年代人人暴富 — Polymarket · 2026-09-23
- goodside 反思:实验室呼吁放缓前沿,动摇了反暂停立场 — goodside · 2026-09-23
- Robinhood CEO 预测:AI 会让律师和程序员更多而非更少 — PeterDiamandis · 2026-09-23
- NumPy 作者类比 AI:共享抽象才能避免被「收租」锁定 — teoliphant · 2026-09-23
- Joe Lonsdale 与 CNBC 主持人激辩 AI 时代的财富分配 — elonmusk · 2026-09-23