Redwood 提案:披露无 CoT 架构,守住 AI 可监控性
Redwood Research 发布新提案,回应 AI 架构演进对可监控性的威胁,提案获得安全研究者 Ryan Greenblatt 等人的背书讨论。核心担忧是:若模型架构从可读的思维链(CoT)转向以不可读的激活状态进行内部思考(所谓「neuralese」),或干脆移除 CoT,人类将失去监督模型推理过程的重要窗口。
已确认
- Redwood Research 发布提案,警告某些架构可能削弱甚至完全移除 CoT 的可监控性。
- 提案建议公司透明披露三方面内容:无 CoT 推理能力、其他可监控性证据,以及维护可监控性的政策。
- Greenblatt 表示基于有限的公开信息,他认为 Google 的 Astra 是一个令人警惕的相关案例。
尚未确认
- 此前有传闻称各实验室在抢跑「neuralese」方向的研发,据转发内容称目前并不属实,仍未得到证实。
为什么重要
- CoT 可监控性被视为当前人类监督强大模型的关键手段之一,若架构层面转向不可读的内部推理,安全评估和对齐验证的工具箱将明显缩水。提案试图通过透明的披露义务,在架构竞赛中守住这条监督底线。
2026-09-11 ~ 2026-09-11 · 5 条相关
一手来源
- Redwood 提议公司披露无 CoT 架构,守住 AI 可监控性底线 — RyanGreenblatt ·
- Greenblatt 警惕 neuralese 架构:AI 或改用不透明激活思考 — RyanGreenblatt ·
- Redwood 提案:厂商应透明披露无 CoT 推理能力以保可监控性 — RyanGreenblatt ·
- 【源头】Redwood 提议公司披露无 CoT 架构,守住 AI 可监控性底线 — RyanGreenblatt · 2026-09-11
- 【源头】Greenblatt 警惕 neuralese 架构:AI 或改用不透明激活思考 — RyanGreenblatt · 2026-09-11
- 实验室被曝抢跑「神经语」传闻,Redwood 提案呼吁守住 CoT 可监控性 — RyanGreenblatt · 2026-09-11
另有 2 条近重复转述:RyanGreenblatt · RyanGreenblatt