预测海啸不能数每月溺水者:AI 安全派主张盯能力与对齐指标
davidmanheim · x · 2026-09-16
davidmanheim 总结这场争论:末日时间点预测确实难以产出关于风险的证据,正因如此应预测能力进展与对齐失灵的先行指标——而这类证据近来明显站在 AI 安全派一边。他称自己做过很多此类预测,但需要更好地可操作化:就像不能靠每月溺亡人数预测海啸,也可能在失控 AI 杀死数十亿人前看不到它杀死几千人的迹象。
「漫话AGI」频道最新
- 可解释性研究者列当下最关键问题:解码模型激活的读心术 — wesg52 · 2026-09-16
- Uncle Bob 拆穿末日论证套路:往方程里塞不存在的魔法变量 — ylecun · 2026-09-16
- 灾难风险建模者:海啸数据启示录——别用历史频率低估 AI 风险 — davidmanheim · 2026-09-16
- Agent 监督成对齐前提:删命令行、完美沙箱还是强化监控 — scottleibrand · 2026-09-16
- 假对齐叠加递归自改进:AI 公司无力分辨真伪对齐 — birchlse · 2026-09-16
- Altman 警告开源模型将掀起网络攻击潮,Beff 称卖防御才是正路 — beffjezos · 2026-09-16