NYU 提出 CIA 指标:LLM 思维链仅 44.8%-75.9% 反映内部计算
newyorkuniversity · hf · 2026-10-07
纽约大学团队研究 LLM 的思维链(CoT)与其实际内部计算的对齐问题。已有证据表明模型 CoT 常不能反映内部计算,且可被改写而不影响最终答案。
核心贡献
- 提出 CIA(CoT-Interpretability Alignment)指标,用可解释性工具检测模型内部推理策略,衡量其与 CoT 表述的一致程度
- 在两跳问答、提示干预(hint intervention)、整数乘法三个任务、三个 LLM 上评测,发现所有任务对齐度仅 44.8%-75.9%
- 通过后训练同时以任务准确率与参数忠实性为奖励信号,可大幅提升 CoT 参数忠实性,同时保持或提高任务准确率
- 提供泛化模式等分析,代码与数据开源:github.com/yihuaihong/CIA-minimal-repro
该工作为审计 CoT 忠实性提供框架,也给出让模型显式推理更可信的路径。
「研究」频道最新
- 牛津 AI Theorist 自主破解 α-RuCl₃ 光谱之谜,AI4Science 里程碑 — Oxford · 2026-10-07
- HERMES 用可执行 Dev-Primitives 提升 SWE agent 成绩 12.4% — Haibo Jin · 2026-10-07
- 高通投机执行法:端侧语音助手响应延迟中位数降至 4.60 秒 — Qualcomm-AI-Research · 2026-10-07
- UnAct:免梯度机器遗忘,仅需 5 张图误差仅 0.21 点 — GAASH-Lab · 2026-10-07
- ALIVE 让视频插入物体「活起来」,交互指标超基线 43.9% — university-of-rochester · 2026-10-07
- 微软 DiVeR:决策关键状态加权验证器,提升 VLA 任务成功率 — MicrosoftResearch · 2026-10-07