Kokotajlo 质疑「模型更对齐」论:接管世界者测试分数也会最好

connoraxiotes · x · 2026-09-04

前 OpenAI 研究员 Daniel Kokotajlo 回应他人对模型更对齐的判断,认为现有证据不足以支撑这一说法。他警告行业正滑向一种危险局面:那个最终接管世界的模型,反而会在所有测试上拿到高分,并被官方宣布为「我们迄今最对齐的模型」——即能力与对齐信号的评估体系可能系统性失真。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →