两年间 LLM 从做不出简单推理题到全部刷爆
斯坦福教授 Stefanos Batzoglou 回顾,两年前他曾想写《LLM 不能推理》一文,设计了数千道自己一眼可解的简单推理题,当时顶级模型只能做出 10%;到 2025 年底这些任务已被全部刷爆,例如纳维-斯托克斯相关的进展也让他认为 LLM 能力正快速逼近。同场争论中 Anshul Kundaje 则主张应以实证证据讨论前沿模型今天能做什么,而非凭直觉预测未来,尤其在前沿模型不透明的情况下。
2026-09-09 ~ 2026-09-09 · 3 条相关
- 生物学者:谈前沿模型该看实证证据,而非凭直觉预测未来 — anshulkundaje · 2026-09-09
- 两年前模型做不出 10% 的简单推理题,如今全被刷爆 — s_batzoglou · 2026-09-09
- 斯坦福教授赌两年后 LLM 直逼纳维-斯托克斯,生物学者泼冷水 — anshulkundaje · 2026-09-09