两年前模型做不出 10% 的简单推理题,如今全被刷爆
s_batzoglou · x · 2026-09-09
Stefanos Batzoglou 回顾:不到两年前他打算写《LLM 不能推理》论文,设计了几千道自己一眼就能解的简单推理题,当时顶级模型只对 10%。到 2025 年底这些任务已全部饱和,现在社区已把目光投向 Navier-Stokes。他押注两年后我们又会在一个截然不同的位置。这是他与 Anshul Kundaje 关于 LLM 推理能力争论的源头推文。
所属事件:两年间 LLM 从做不出简单推理题到全部刷爆(3 条相关)→
「漫话AGI」频道最新
- Stratechery:OpenAI 数学突破影响有限,Meta 个人 Agent 潜力更大 — Stratechery · 2026-09-09
- 图像 prompt 信息量 ≈ 按快门,牛津学者重审「AI 生成不算艺术」论 — tobyordoxford · 2026-09-09
- 学编程十年不如练表达?网友称英语写作加策略游戏才是真技能 — RachelVT42 · 2026-09-09
- Burn-Murdoch:弱化核心技能不止英国,芬兰模式同样如此 — jburnmurdoch · 2026-09-09
- FT首席数据记者:科技侵蚀学习过程,循证教学与核心技能更关键 — jburnmurdoch · 2026-09-09
- 硅谷读《国家的视角》只学皮毛:把用户简化成 MAU/DAU 指标 — tobowers · 2026-09-09