重复堆叠层是否毁掉 CoT 可监控性?安全圈激辩模型纵深

voooooogel · x · 2026-09-04

有人质疑:为什么把 N 层块重复堆两次会「神奇地」破坏思维链(CoT)的可监控性?Meta 的 MobileLLM 也用了层重复技术,这难道只是「深模型就是坏」?

作者回应称,最强的辩护论证是:模型内部能力越强,若在暗中图谋(scheming),越不需要在 CoT 里外化——小模型(如 haiku)比大模型更需要在思维链里表现出 eval awareness。但他承认,这个论证实际上构成对一切模型加深或 scaling 的通用反对理由。

所属事件:层重复架构疑云引发 CoT 可监控性激辩(7 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →