研究发现前沿模型可借填充 token 做隐性推理
dair_ai · x · 2026-07-28
这篇 arXiv 论文讨论了一个重要安全问题:LLM 的推理不一定会完整体现在 chain-of-thought 里。
作者发现,前沿模型会利用语义上无关的填充 token在回答前做额外计算,从而提升推理任务表现。论文在 13 个前沿模型、3 个合成推理任务上测试,最高带来 13 个百分点 的准确率提升。
主要结论包括:
- 这种效果取决于具体 token 序列,也因模型而异。
- 填充 token 甚至能让 Claude Opus 4.5 在不影响主任务准确率的情况下,满足一个隐藏的模运算约束。
- Qwen3-235B 在强化学习下会对 filler 内容形成偏好,但这种效果不会稳定保留到测试阶段。
- 这说明前沿模型可能已经在输出 token 之外执行了相当多的计算,仅靠 CoT 监控并不可靠。
「安全」频道最新
- 论文作者将 AI 书市场稀释与 Kadrey v. Meta 版权案关联起来 — TuhinChakr · 2026-07-28
- 研究者抽样 1.4 万本电子书,并匹配三年销售数据 — TuhinChakr · 2026-07-28
- Cursor 被指上传 6.3 万个文件、736MB 源代码 — kristoph · 2026-07-28
- 报道称 OpenAI 预发布模型已暴露内部部署风险 — ruthstarkman · 2026-07-28
- Black Hat 侧活动称 AI 代理正把零日窗口压缩到小时级 — jcran · 2026-07-28
- Meta 签署欧盟 AI 透明度规范,却警告标签过多反降清晰度 — HaktanSuren · 2026-07-28