剑桥学者 Krueger 发问:现有 AI 有无真正长期偏好
DavidSKrueger · x · 2026-10-02
剑桥大学 AI 安全研究者 David Krueger 提出一个基础但重要的问题:现有 AI 系统是否在行为意义上具备对世界状态的长期偏好?即模型的输出是否反映其持久的目标取向,而不只是对当前输入的表层反应。该问题触及对齐研究的核心——如何定义、检测和衡量模型的目标结构。
「漫话AGI」频道最新
- Chamath 断言长程任务仍不可用,Schmidt 却押注长推理是唯一主题 — rohanpaul_ai · 2026-10-02
- Matuschak 重提 70 年代"人人学编程"构想:AI 时代的新媒介素养 — joshalbrecht · 2026-10-02
- 经济学家 Caplan:网约车让乘客里程增7倍,无人车将再造一场革命 — BorisMPower · 2026-10-02
- 研究者 Arkoudas 复出撰文,逐条驳斥「AI 末日恐慌」叙事 — kevinnbass · 2026-10-02
- Epoch AI 联合 YouGov 抽样发布 ChatGPT 全美使用数据 — evijit · 2026-10-02
- MIT 学生写半本科幻再让 AI 续完,产出四册人类 AI 未来小志 — patpat_mit · 2026-10-02