前OpenAI科学家提出AI对齐“一团糟”理论
前OpenAI核心科学家Jascha Sohl-Dickstein提出了反直觉的AI对齐“一团糟”理论。该理论指出,当前AI模型表现出的诸多问题,往往并非源于底层的“价值不对齐”,而是模型在逻辑上的“不连贯”。这意味着随着AI变得越来越聪明,其行为的不连贯性可能也会增加,这是导致当前AI系统失败的核心原因。
2026-08-09 ~ 2026-08-09 · 2 条相关
- 越聪明越不连贯?前 OpenAI 科学家提出 AI 对齐「一团糟」理论 — akbirthko · 2026-08-09
- 当前 AI 失败多源于“不连贯”而非价值对齐失误 — akbirthko · 2026-08-09