对齐研究者反思短时间线论证:缺乏机制性解释易致安全工作跑偏

JacquesThibs · x · 2026-09-20

AI 对齐研究者 Jacques Thibs 在 LessWrong 上 Richard Ngo 的 Shortform 评论区发表了对 AI 时间线(timelines)预测的看法。

他坦承自己此前更倾向短时间线(2022 年起就因此从事自动化对齐研究),但如今预测分布已经变宽。他批评许多短时间线支持者的论证流于懒惰——过度依赖「模型在变强」和「看空者一直被打脸」这类论据,缺乏对当前能力来源的机制性描述,以及这些能力与递归自我改进(RSI)和「真正的 AGI」之间关系的清晰论证。

他强调自己并非贬低短时间线观点(他仍认为其有相当概率成立),而是呼吁更清晰的写作与更有说服力的论证——因为细节直接关系到超级对齐(superalignment)的进展判断,含糊其辞可能让整个 AI 安全领域聚焦在完全错误的问题上。他计划后续专门做拆解这类预测的工作。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →