Anthropic 电路追踪研究逆向工程 Claude 内部推理机制
austinc3301 · x · 2026-10-04
作者在讨论 LLM 如何「思考」时推荐 Anthropic Transformer Circuits 团队的论文《On the Biology of a Large Language Model》:用电路追踪(circuit tracing)方法逆向工程 Claude 3.5 Haiku 在多种情境下的内部机制。
- 核心观点:现代 LLM 并非马尔可夫链式预测器,而是拥有复杂的世界模型,混合启发式与算法来解决问题;其推理方式与人类实现截然不同,但在常识意义上确实在推理
- 论文将理解 LLM 类比为生物学:训练算法简单,产生的机制却极其复杂,需要像显微镜那样的新工具来观察
- 作者包括 Chris Olah 等可解释性研究核心成员,2025 年 3 月发布
「研究」频道最新
- 13 个 AI 模型玩问诊游戏:195 次全诊断正确,安全表现才见分晓 — radeon2000 · 2026-10-04
- MuscleMimic 开源:同时控制人体 354 块肌肉,链式动作零样本泛化 — TinfoilTricorn · 2026-10-04
- Yacine 吐槽:论文自称碾压 SOTA,一查对比的是未调参基线 — yacineMTB · 2026-10-04
- 实测发现 LLM 评委按位置打分:A/B 对调后 10-12% 判决翻转,更大模型也没用 — Beneficial_Use2116 · 2026-10-04
- BF16 舍入破坏守恒律,FlashAttention 梯度训练后期爆炸 — HongyiWang10 · 2026-10-04
- 微软提出 ActiveSaddler:动态调整训练场景,agent 优化器 Pass@1 提升最高 7.5 分 — dair_ai · 2026-10-04