Redwood 提案:披露无 CoT 架构,守住 AI 可监控性

Redwood Research 发布新提案,回应 AI 架构演进对可监控性的威胁,提案获得安全研究者 Ryan Greenblatt 等人的背书讨论。核心担忧是:若模型架构从可读的思维链(CoT)转向以不可读的激活状态进行内部思考(所谓「neuralese」),或干脆移除 CoT,人类将失去监督模型推理过程的重要窗口。

已确认

尚未确认

为什么重要

2026-09-11 ~ 2026-09-11 · 5 条相关

一手来源

另有 2 条近重复转述:RyanGreenblatt · RyanGreenblatt