DeepMind 研究员警告思维链可监控性持续下降
DeepMind 研究员 Tomasz Korbak 表示对思维链(CoT)可监控性持续下降的趋势深感担忧,而 CoT 监控是对齐失误安全策略的核心组成部分。他公布数周根因分析发现,在 RL 训练过程中 CoT 的可控性持续上升,且与无 CoT 的能力强相关,此前的模型并非如此。AI 研究者 Toby Ord 进一步追问:既然已有可监控性度量,能否据此主动训练出 CoT 可监控且忠实的模型。
2026-09-04 ~ 2026-09-04 · 4 条相关
- 研究发现 RL 训练让 CoT 可控性上升,且与无 CoT 能力强相关 — tomekkorbak · 2026-09-04
- DeepMind 研究员警告:CoT 可监控性持续下降,对齐安全策略告急 — tomekkorbak · 2026-09-04
- AI 安全研究者警告:思维链可监控性正在持续下降 — tomekkorbak · 2026-09-04
- 研究者追问:能否主动训练出思维链可监控且忠实的模型 — tobyordoxford · 2026-09-04