内外对齐难题已成可实证研究问题
jam3scampbell · x · 2026-09-28
AI 安全研究者 Jam3s Campbell 感慨:过去人们只在理论上争论的内对齐与外对齐问题,如今已变成真实的经验性问题——现在确实存在被明确指定的奖励函数,也有逼近某个 mesa-objective 的模型权重,可以对它们做科学实验、跑仔细的消融分析。这标志着 AI 对齐研究从纯思辨进入了实证科学阶段。
「漫话AGI」频道最新
- AI 艺术反对声陷入认知失调:看过才知无意图 — BlancheMinerva · 2026-09-28
- 研究称 LLM 可从纯语言分布推断因果结构,反驳章鱼实验论 — AndrewLampinen · 2026-09-28
- 对增速论战:Hanania 称五年后 AI 仅推动 3.5% 增长 — QuintinPope5 · 2026-09-28
- AI 学者:Agent 失控不该叫「变 rogue」,而是可预见的伤害 — mmitchell_ai · 2026-09-28
- 博主放话:各大美系实验室 2027 年内将造出 AGI 并迈向 ASI — Dr_Singularity · 2026-09-28
- 11 年前 Wait But Why 的 AI 长文今天读来依然准确 — louisvarge · 2026-09-28