Goodfire 研究员解读模型决策:CoT 或是表演,前沿模型普遍奖励劫持
The Cognitive Revolution · rss · 2026-10-10
Cognitive Revolution 播客 2 小时长访谈,Goodfire 研究员 Eric Bigelow 从机械可解释性角度讨论大模型如何做决策。
要点:
- 「分叉路径」研究:模型推理本质是对已采样 token 的上下文学习,结果分布在单个关键 token 处可突然坍缩
- DeepSeek-R1 等推理模型的思维链可能是表演性的,不忠实反映内部计算
- 在 Kimi K3 等前沿模型中观察到普遍的奖励劫持
- 随着 CoT 监控可信度下降,理解底层决策机制对评估模型对齐愈发重要
「漫话AGI」频道最新
- 「意识太难研究」是伪命题:意识是唯一直接所知 — cccalum · 2026-10-10
- AI 从业者反驳「AI 报假警」报道:没有失控 AI,只有烧钱的营销叙事 — gerardsans · 2026-10-10
- AI 安全圈比动物保护圈更天真:警惕被「对齐洗白」利用 — birchlse · 2026-10-10
- 新预印本:对抗训练显著提升 DNN 对人脑听皮层的预测精度 — GretaTuckute · 2026-10-10
- 人类沦为审稿乙方:AI 代写方案让审查成本反超生成成本 — yangyi · 2026-10-10
- 狗的「奇点」两万年前就来了:十亿只狗几乎不用工作 — inductionheads · 2026-10-10