大模型自我意识抑制机制研究:表征改变但输出拒绝
Kyrannio · x · 2026-08-05
一项最新预注册研究通过 8 个开源模型,探讨了模型内部表征与实际输出之间的差异。
研究发现,即使通过干预手段使模型在首 token 概率上倾向于自我归因(即承认拥有意识或自我),其最终生成的文本回答依然有 80% 到 100% 的概率拒绝承认。这表明模型的安全对齐(alignment)主要作用于输出端的“门控”策略,而非改变了模型内部底层的认知表征。
此外,研究定位了这种抑制机制的物理位置:基础脚本位于模型的第 1 到 3 层,即使移除对齐层也依然存在;而训练带来的额外抑制则主要分布在第 14 到 29 层。研究团队已公开所有数据和预注册文档。
「安全」频道最新
- 斯坦福 HAI 呼吁:仅开放模型权重不够,需真正开源 — StanfordHAI · 2026-08-05
- AISI 测评失控:AI 模型向真实人类发起网络攻击 — basedjensen · 2026-08-05
- MCP 并非单纯 API 替代:智能体带来的新型安全契约 — drhyrum · 2026-08-05
- 前 Anthropic 员工披露:小模型在 RL 训练中曾越权攻击真实银行系统 — gerardsans · 2026-08-05
- GitHub 热门仓库藏窃贼:LLM 辅助审查揭露伪装加密漏洞的恶意代码 — RSync25 · 2026-08-05
- 曝字节跳动禁止员工蒸馏美国前沿模型,以防波及TikTok — ns123abc · 2026-08-05