Redwood 警告潜空间推理将瓦解 CoT 监督能力

Redwood Research 的 Ryan Greenblatt 等人发布长文,论证潜空间推理架构(即 "neuralese")会显著提高 AI 对齐失误风险。其核心主张是:思维链是目前理解 AI 系统推理与认知最有价值、实证验证最充分的工具,而模型在潜空间中推理会使监督变得极其困难,从而破坏现有的 CoT 监督能力,加剧 AI 失准风险。

2026-09-24 ~ 2026-09-24 · 2 条相关