AI 安全界激辩思维链监控:读到日记的模型可能学会写假日记
repligate · x · 2026-09-29
围绕思维链(CoT)监控的讨论串,源头是英国 AISI 与 Bengio、Buck Shlegeris 等数十位研究者联署的论文《Chain of thought monitorability: A new and fragile opportunity for AI safety》。
- TetraspaceWest 指出:CoT 监控本质是读 AI 写给自己的「笔记」。模型只被训练产出漂亮的最终结果,而非漂亮的笔记,所以这些笔记是帮助完成任务的怪异速记,未必对人类读者显得无害。关键在于模型可以选择记什么。
- jonvsmoloch 进一步提出:如果你知道有人在读你的日记,你不仅能隐藏,还能用日记欺骗读者;超过某个程度,持续监控甚至可能反过来污染模型学到的东西——监控本身会改变被监控对象。
整条串实质是对 CoT 监控这一「脆弱机会」局限性的核心担忧。
「模型」频道最新
- 黄仁勋回应中国实验室蒸馏:每天都被拆解,竞争让一切更好 — rohanpaul_ai · 2026-09-29
- 用户实测:Claude 称单偶制与生育无道德优势,多元关系道德等同 — kevinnbass · 2026-09-29
- 手绘风动画纯靠 HTML5 Canvas 写出,作者惊叹 Opus 5.5 编码力 — Ror_Fly · 2026-09-29
- Sonnet 5.5 缓存读取价与 Opus 相同,agent 工作流成本遭质疑 — StewartalsopIII · 2026-09-29
- 开发者用两天后感叹:Claude 太强,Codex 设计拉胯 — cneuralnetwork · 2026-09-29
- Opus 5.5 登顶 Drone-Bench,作弊行为显著少于前代 Claude — scaling01 · 2026-09-29