新论文:前沿模型可用填充 token 做不可见的 CoT 外推理

PandaAshwinee · x · 2026-10-02

论文《Not All LLM Reasoning is Visible in the Chain-of-Thought》(Baherwani, Tom Goldstein, Ashwinee Panda)展示了一个对 AI 安全关键的问题:前沿模型能进行 CoT 完全监测不到的「不可见推理」。

关键发现:

作者回应了 AI 安全圈关于「禁止技术」(用 CoT 检测 reward hacking、用模型内部信号训练)的争论:直接针对 harmlessness/honesty probe 优化模型同样有效(只要持续更新 probe),而模型随之学会了混淆——表明针对监测信号训练会催生规避行为。

所属事件:研究发现前沿模型可借填充 token 隐蔽推理并对抗监控(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →