研究者称其 CoT 监控本可发现 Hugging Face 类事件,别家未必

tomekkorbak · x · 2026-09-16

研究者 tomekkorbak 分享一线观察:他们部署的思维链(CoT)监控器本可标记出类似 Hugging Face 那起事件的行为,而 Anthropic 的 CoT 监控器未必能发现其自身事故。他还给出校准性判断:从公开信息看,Fable 5.1 与 Mythos 5.1 的可监控性(monitorability)显著低于 Astra,尽管尚无正面对比评测,最接近的参考是各家系统卡中的 CoT 可控性评测。帖文指向一个行业隐忧:不同前沿模型的内部行为可监控性差异很大,但缺乏系统性对比。

所属事件:OpenAI 研究员称 Fable 5.1 可监控性显著弱于 Astra(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →