研究者谈模型可监控性:更强模型正变得越难监控

sandersted · x · 2026-09-05

安全研究者 sandersted(回应 @tomekkorbak 与 @robertwiblin)说明其团队正研究如何让未来模型更具可监控性(monitorable),并讨论权衡:投入多少研究资源?是否应停发可监控性差但更对齐、更有用的模型?其确认的事实:CoT 监控有价值但不完美;更强模型正变得可监控性更差且 eval-aware(不只 OpenAI 一家);随模型变强,对齐与监控愈发关键。

所属事件:CoT 可监控性下降引安全激辩:对齐与监控如何取舍(15 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →