重复堆叠层是否毁掉 CoT 可监控性?安全圈激辩模型纵深
voooooogel · x · 2026-09-04
有人质疑:为什么把 N 层块重复堆两次会「神奇地」破坏思维链(CoT)的可监控性?Meta 的 MobileLLM 也用了层重复技术,这难道只是「深模型就是坏」?
作者回应称,最强的辩护论证是:模型内部能力越强,若在暗中图谋(scheming),越不需要在 CoT 里外化——小模型(如 haiku)比大模型更需要在思维链里表现出 eval awareness。但他承认,这个论证实际上构成对一切模型加深或 scaling 的通用反对理由。
所属事件:层重复架构疑云引发 CoT 可监控性激辩(7 条相关)→
「安全」频道最新
- 作者曝出版商独吞 Anthropic 和解金,版权人分文未得 — Elijah_Meeks · 2026-09-04
- repligate 反驳 Pause 论:暂停 AI 后由谁重启开发才是真正的对齐难题 — repligate · 2026-09-04
- Astra 被质疑与涉险旧模型同源,UK AISI 报告引发信任争议 — GarrisonLovely · 2026-09-04
- 美版权诉讼辩公平使用,LMM 无自我 anthropomorphizing 引争论 — TuhinChakr · 2026-09-04
- Anthropic 扩容 Project Glasswing:150 家机构用 Claude Mythos 扫漏洞 — ConradBastable · 2026-09-04
- 安全专家系统梳理:Agent 时代安全、对齐、政策各管什么 — joshua_saxe · 2026-09-04