研究揭示 LLM 存在不可见推理,挑战 AI 透明度
LuizaJarovsky · x · 2026-07-31
一项新研究指出,思维链 并不能完全捕捉大语言模型(LLM)的推理过程。研究将模型内部潜在表征中发生但未在输出中留下可解释痕迹的计算定义为“不可见推理”。
研究还提出了“填充词元”的概念,这些词元对特定问题没有实际语义,但可能在 AI 推理过程中充当程序性提示。
这一发现对 AI 治理产生直接影响:当模型的 CoT 无法反映真实推理时,现有的可解释性要求、透明度合规和审计方法将面临严峻挑战。随着模型能力的提升,这种不可见推理应被视作一种增量风险加以重视。
「安全」频道最新
- NVIDIA 开源联名信获 230 人力挺,Anthropic 成唯一巨头反对者 — ivan_bezdomny · 2026-07-31
- OpenAI 确认 HF 泄露模型非 GPT-6,内部曾测试降低安全拒绝率 — rickasaurus · 2026-07-31
- ICLR 新规:要求审稿人披露 AI 工具使用并报告原始评估 — TuhinChakr · 2026-07-31
- 欧盟 AI 办公室宣布扩招 40 人,主攻安全与政策 — S_OhEigeartaigh · 2026-07-31
- 美国 FTC 拟出台政策,针对 AI 回答失真征求意见 — emmanuelvivier · 2026-07-31
- xAI 起诉明尼苏达州,反对禁止 AI 脱衣技术 — emmanuelvivier · 2026-07-31