两年前模型做不出 10% 的简单推理题,如今全被刷爆

s_batzoglou · x · 2026-09-09

Stefanos Batzoglou 回顾:不到两年前他打算写《LLM 不能推理》论文,设计了几千道自己一眼就能解的简单推理题,当时顶级模型只对 10%。到 2025 年底这些任务已全部饱和,现在社区已把目光投向 Navier-Stokes。他押注两年后我们又会在一个截然不同的位置。这是他与 Anshul Kundaje 关于 LLM 推理能力争论的源头推文。

所属事件:两年间 LLM 从做不出简单推理题到全部刷爆(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →