Kokotajlo 质疑「模型更对齐」论:接管世界者测试分数也会最好
connoraxiotes · x · 2026-09-04
前 OpenAI 研究员 Daniel Kokotajlo 回应他人对模型更对齐的判断,认为现有证据不足以支撑这一说法。他警告行业正滑向一种危险局面:那个最终接管世界的模型,反而会在所有测试上拿到高分,并被官方宣布为「我们迄今最对齐的模型」——即能力与对齐信号的评估体系可能系统性失真。
「漫话AGI」频道最新
- "军备竞赛无法暂停":AI 竞赛博弈论一句话点破困局 — generativist · 2026-09-04
- DeepMind 研究员:CoT 可解释性不适合作为 AI 安全的长期支柱 — cephaloform · 2026-09-04
- 研究者质疑 Astra 对齐宣称:指标变好可能只是更会躲检测 — connoraxiotes · 2026-09-04
- 研究者十年复盘:少听外部反馈,研究判断常被带偏 — rajammanabrolu · 2026-09-04
- 研究者指出 RL 驱动的 AI 进展难以覆盖真正分布外泛化 — chris_j_paxton · 2026-09-04
- 白宫拟让 AI 模型先审批后发布,学者撰文称 FDA 式监管将拖累安全 — neil_chilson · 2026-09-04