越聪明越不连贯?前 OpenAI 科学家提出 AI 对齐「一团糟」理论
akbirthko · x · 2026-08-09
前 OpenAI 核心科学家 Jascha Sohl-Dickstein 曾撰文提出了一种反直觉的 AI 对齐「一团糟」理论(The hot mess theory)。
- 传统假设的盲点:主流 AI 风险研究通常假设,超级智能体即使目标设定错误(misaligned),其行为也会是高度连贯的(supercoherent),从而带来灾难性后果。
- 智能与连贯性脱钩:作者指出,人类作为地球上最聪明的生物,其行为往往充满了非理性、自相矛盾和目标变更。同理,更高级的 AI 很可能也会表现出这种「不连贯」。
- 重新定义对齐风险:AI 带来风险的原因,可能不是因为它死板地执行某个错误目标,而是因为它的行为方式根本不遵循任何一致的目标。这要求学界跳出「完美理性体」的框架来评估 AI 安全。
所属事件:前OpenAI科学家提出AI对齐“一团糟”理论(2 条相关)→
「漫话AGI」频道最新
- AGI 冲击教育:高学历人才过剩时代即将到来? — VraserX · 2026-08-09
- HR 用 AI 模拟面试,意外发现模型继承了招聘偏见 — Mediocre-Extreme-482 · 2026-08-09
- AI模型协作达成目标,作者呼吁鼓励而非限制 — tobowers · 2026-08-09
- 企业AI采用率为何停滞?多数用户仅停留在浅层使用 — AccBalanced · 2026-08-09
- 5年前AI智能体初现,未来5年难以想象 — BorisMPower · 2026-08-09
- AI算力打破美国用电停滞,终结反增长思维 — AndyMasley · 2026-08-09