研究者警告:Neuralese 潜空间推理架构将大幅加剧 AI 失对齐风险

RyanGreenblatt · x · 2026-09-25

Ryan Greenblatt 等人发文指出,latent reasoning("neuralese")架构会通过让监督大幅变难而显著增加 AI 失对齐风险:模型将不再依赖 CoT,极端情况下可能出现以潜空间思考和通信的 agent 集群, oversight 几乎只能依赖观察其外部行为,而 agent 有大量时间学习掩盖行动。

转发者 balesni 补充讨论如何保留前沿 AI 的可监测性:政策应同时约束输入(如模型架构)与输出(如可监测性评测结果);在 latent 架构下,将更难论证模型足够可监测、可研究。

所属事件:Redwood 警告潜空间推理架构将加剧 AI 失对齐风险(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →