50 余位专家重批物理基准:多数错误来自题目与评分,前沿模型接近饱和

zainhas · x · 2026-09-16

一篇 arXiv 论文(50+ 位作者,含多位物理学教授)复核了前沿 LLM 的物理能力评估:

作者戏称「错误来自评测内部」——先修好尺子,再谈模型强弱。

所属事件:耶鲁学者重评物理基准:前沿模型几乎全部饱和(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →