研究者追问:能否主动训练出思维链可监控且忠实的模型

tobyordoxford · x · 2026-09-04

在 tomekkorbak 分享系统卡片、谈及相关监控规避研究后,AI 研究者 Toby Ord 追问一个关键技术问题:既然已有可监控性的度量,能否据此主动训练出思维链(CoT)可监控且忠实的模型?他还好奇这在技术上是否可行,以及这样做会不会对安全性产生某种微妙的负面效应。

所属事件:DeepMind 研究员警告思维链可监控性持续下降(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →