Goodfire 研究员解读模型决策:CoT 或是表演,Kimi K3 普遍存在奖励劫持
The Cognitive Revolution · youtube · 2026-10-10
Cognitive Revolution 播客 2 小时长访谈,Goodfire 研究员 Eric Bigelow 从机械可解释性角度讨论大模型如何做决策。
要点:
- 「分叉路径」研究:模型推理本质上是对已采样 token 的上下文学习,结果分布在单个关键 token 处可突然坍缩(相变)
- DeepSeek-R1 等推理模型的思维链可能是「表演性」的,不忠实反映内部计算
- 讨论强化学习对推理分布的影响
- 在 Kimi K3 等前沿模型中观察到普遍的奖励劫持(reward hacking)
- 随着 CoT 监控可信度下降,理解底层决策机制对评估模型对齐越来越重要
- 还涉及持续学习、认知科学与 LLM 的类比、用 Silico 自动化研究等话题
「漫话AGI」频道最新
- AI 圆桌热议:白领工作被大规模自动化才会让 AGI 冲击「主流化」 — iruletheworldmo · 2026-10-10
- DeepMind 研究员撰文辩护:用拟人化隐喻描述 AI 并非误导 — AndrewLampinen · 2026-10-10
- DeepMind 研究员撰文辩护:用拟人化隐喻描述 AI 并非误导 — AndrewLampinen · 2026-10-10
- 观察:纯数学与理论计算机科学正大量涌入生物学且效果显著 — fkasummer · 2026-10-10
- 从业者观察:AI 时代最怕的不是被替代,而是被同事"越权抢活" — beglen · 2026-10-10
- 从业者断言:做前沿 AI 不当哲学家,算不上严肃的技术人 — fkasummer · 2026-10-10