AlphaGo 核心作者 Graepel 断言:LLM 不会推理,规模补不出系统2
机器之心 · wechat · 2026-10-04
AlphaGo 核心作者之一 Thore Graepel 离开 Google DeepMind 创业,并在 MIT Technology Review 发文《别被骗了——LLM 不会推理》。机器之心梳理全文及后续争论。
核心论点
- AlphaGo 的第 37 手不是「机器直觉」:策略网络给出人类职业棋手约万分之一概率,是搜索机制显式构建博弈树推演数千分支后选中了它。直觉+搜索,卡尼曼式系统1+系统2 缺一不可。
- LLM 本质是预测下一个 token,即被练到极致的系统1;思维链只是拉长的直觉,仍是同一 token 预测过程,没有引入独立的推理机制。
- LLM 三大短板:无可检查、可更新的认知状态;知识与推理不分离;思维链常是事后编造的解释。
他的替代方案:借鉴 AlphaGo 维护博弈树的思路,构建显式认知状态的通用推理系统,推理是改变认知状态的动作,由按「消解多少不确定性」评估的独立裁判更新信念——「打了兴奋剂的科学方法」。
争议:David Duvenaud 指出三条罪状人类同样成立,Graepel 回应称诀窍是把过程结构化(纸笔+科学方法),被追问「这正好是你创业要做的事吧」;也有网友认为「不会推理」论早已过时,Graepel 以医疗可靠性三连问回击。他直言前沿实验室都在押注 scaling,而可审计推理需要不同架构,「激进新想法在大组织内更难实现」。
「漫话AGI」频道最新
- LLM 两年进步仅渐进非指数,争论再起 — inductionheads · 2026-10-05
- Gary Marcus 附议 WSJ 质疑:AI 开支达 GDP 9% 存在天然天花板 — GaryMarcus · 2026-10-05
- Timnit Gebru 获另类诺贝尔奖:AI 生存风险论是逃避监管的把戏 — PolarBearby · 2026-10-05
- 若新冠疫情发生在 2026,OpenAI 等会多快造出疫苗? — flowersslop · 2026-10-05
- FDT 在逻辑不确定性下如何定义?决策理论社区深入争论 — jessi_cata · 2026-10-05
- AGI 人人可生成神作后,共享文化会消失吗? — 1337_420_69 · 2026-10-05