对齐 vs 可监控:X 上围绕 CoT 监控必要性展开的辩论

sandersted · x · 2026-09-05

一场关于模型对齐与可监控性的观点交锋。sandersted 表示:如果只能二选一,他宁愿要一个已对齐的模型,也不要一个仅仅可被监控的模型;但他强调监控能提高对齐置信度,并指出双方真正的分歧点(crux)在于:通用行为监控在多大程度上必须依赖思维链(CoT)监控。他还类比人类:人们通过长期跨情境的行为观察来判断一个人是否可靠,但前提是这个体只有「Ted 级」的权力;若模型拥有「上帝级」能力,就需要更强的保证手段。

所属事件:CoT可监控性下降引发AI安全圈对齐与监控之争(10 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →