新论文:LLM 推理操作在内部可分离,错误计算也带正确「签名」
rohanpaul_ai · x · 2026-09-24
arXiv 论文《Beneath the Surface of Chains-of-Thought》对 LLM 思维链做了机制可解释性分析,核心发现:
- 推理有内部结构:模型「想做什么」和「做得对不对」在内部是可分离的,为从模型内部监测推理打开了一条路。
- 8 种推理操作各有指纹:提取事实、分解、回忆、演绎、代数、计算等操作各自产生独特的内部激活模式,且在中间层最清晰;同一个 token 在承担不同推理任务时内部表征也不同。
- 上下文影响状态:屏蔽前 30 个 token 后,下一个推理操作的信号会减弱。
- 最反直觉的发现:错误的计算或演绎仍可能携带「正确的操作签名」——模型能表征自己正在尝试哪种推理,而不保证推理正确。
「研究」频道最新
- Q Labs 研究:LLM 深度严重受限,128 层仍在持续改进 — rickasaurus · 2026-09-24
- OverclaimBench:68% 运行中编码 agent 漏看文件仍宣称已审完 — hugo_larochelle · 2026-09-24
- CoRL 论文 TANGO:RGB 直接输出 29 自由度,人形机器人全身导航 — berkeley_ai · 2026-09-24
- 北航等八机构发布 Theory of Agent 综述,覆盖约 600 项研究 — jiqizhixin · 2026-09-24
- GPT-6 Astra 证明 Erdős–Sós 图论猜想,Lean 验证通过 — IgorCarron · 2026-09-24
- NEJM AI 文章探讨 AI 时代的科学思维与科研教育建议 — zakkohane · 2026-09-24