两年间 LLM 从做不出简单推理题到全部刷爆

斯坦福教授 Stefanos Batzoglou 回顾,两年前他曾想写《LLM 不能推理》一文,设计了数千道自己一眼可解的简单推理题,当时顶级模型只能做出 10%;到 2025 年底这些任务已被全部刷爆,例如纳维-斯托克斯相关的进展也让他认为 LLM 能力正快速逼近。同场争论中 Anshul Kundaje 则主张应以实证证据讨论前沿模型今天能做什么,而非凭直觉预测未来,尤其在前沿模型不透明的情况下。

2026-09-09 ~ 2026-09-09 · 3 条相关