剑桥学者 Krueger 发问:现有 AI 有无真正长期偏好

DavidSKrueger · x · 2026-10-02

剑桥大学 AI 安全研究者 David Krueger 提出一个基础但重要的问题:现有 AI 系统是否在行为意义上具备对世界状态的长期偏好?即模型的输出是否反映其持久的目标取向,而不只是对当前输入的表层反应。该问题触及对齐研究的核心——如何定义、检测和衡量模型的目标结构。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →