小模型物理推理能力惊人地差,且缺乏针对性基准

auto_grad_ · x · 2026-10-03

autograd 指出小型语言模型在物理与物理推理上依然「难以置信地差」,并追问两个问题:为什么会这样?为什么缺少专门验证物理理解的基准?

他认为,理解物理(现象是什么、为何起作用、如何影响具体过程)可能是通往通用推理的关键路径,因此这一方向值得建立专门评测。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →