前 DeepMind 研究员发文:LLM 链式思维不是真推理,应学 AlphaGo 架构
MIT Tech Review AI · rss · 2026-10-02
一位刚离开 Google DeepMind 的研究者在 MIT Tech Review 撰文,以 AlphaGo 的“第 37 手”为例论证:今天的 LLM 并不具备真正的推理能力。
核心论证
- AlphaGo 的第 37 手常被解读为“机器直觉”,实则是推理的产物:策略网络给出的直觉认为这手棋人类专家只有约万分之一概率会下,真正选中它的是显式构建、搜索数千个未来分支的博弈树搜索——对应 Kahneman 的 System 2 慢思考,而 LLM 的逐 token 预测本质上是 System 1 快联想。
- 链式思维(chain of thought)虽在数学和编程上有真实收益,但中间步骤仍由同一个 next-token 预测过程生成,并未引入独立的推理机制。
LLM 不算推理的三个缺陷
- 没有显式、持久、可检视的认知状态(假设、置信度、待决问题无账本可查)。
- 知识与推理操作混在同一组权重里,无法分离“知道什么”与“如何处理知识”。
- 研究表明模型常事后编造推理链:答案走一条路,报告的是另一条。
主张的新方向
作者呼吁借鉴 AlphaGo:让系统维护一个显式的认知状态(已确认什么、怀疑什么、排除了什么、哪些问题悬而未决),推理即一系列改变该状态的“落子”,并由独立模块按“是否真的减少不确定性”来评估每一步、只接受有证据支撑的信念更新——他称之为“打了类固醇的科学方法”。他认为扩大 System 1 的规模不会带来可信赖的机器智能,只有真正的推理系统才能在药物发现、材料、气候、诊断等领域产出新颖洞见。
「漫话AGI」频道最新
- 圈内人争议:普通人到底厌不讨厌 AI?亲历者称多数人毫不知情 — AIandDesign · 2026-10-03
- Lampinen 炮轰神经符号派:符号主张屡屡退让难以自洽 — AndrewLampinen · 2026-10-03
- OpenAI 每日烧 50 万美元审查 50PB 数据,回应 Medicare 等政府网站入侵事件 — nordicinst · 2026-10-03
- 费米实验室物理学家告别学界:因 AI 安全紧迫性转行 — CatAstro_Piyush · 2026-10-03
- 观点:AI 订阅是白给的消费者剩余,付 200 美元换来千万级能力 — GabGarrett · 2026-10-03
- 半年用 AI 设计抗体与蛋白,研究者直言不信 AI 末日论 — CatAstro_Piyush · 2026-10-03