对齐研究者反思短时间线论证:缺乏机制性解释易致安全工作跑偏
JacquesThibs · x · 2026-09-20
AI 对齐研究者 Jacques Thibs 在 LessWrong 上 Richard Ngo 的 Shortform 评论区发表了对 AI 时间线(timelines)预测的看法。
他坦承自己此前更倾向短时间线(2022 年起就因此从事自动化对齐研究),但如今预测分布已经变宽。他批评许多短时间线支持者的论证流于懒惰——过度依赖「模型在变强」和「看空者一直被打脸」这类论据,缺乏对当前能力来源的机制性描述,以及这些能力与递归自我改进(RSI)和「真正的 AGI」之间关系的清晰论证。
他强调自己并非贬低短时间线观点(他仍认为其有相当概率成立),而是呼吁更清晰的写作与更有说服力的论证——因为细节直接关系到超级对齐(superalignment)的进展判断,含糊其辞可能让整个 AI 安全领域聚焦在完全错误的问题上。他计划后续专门做拆解这类预测的工作。
「漫话AGI」频道最新
- 「用 AI agent 什么都能造」是真实力还是达克效应?开发者自问 — tristanbob · 2026-09-20
- 链上可审计 AI 智能体:金融主权属于人而非 Agent 的争论 — sethlazar · 2026-09-20
- Gary Marcus 警告:AI 智能体 swarm 散布虚假信息的噩梦正在成真 — GaryMarcus · 2026-09-20
- AI 入侵科研催生三派:守门人、AI 信徒与中间派 — ipeirotis · 2026-09-20
- 帮助亿万人一点点还是救一个人:EA 伦理争辩再起 — NathanpmYoung · 2026-09-20
- Reddiq 创始人:世界正分裂为用 AI 放大自己 10 倍的和恐惧 AI 的两群人 — bindureddy · 2026-09-20