耶鲁物理学家重评前沿模型:多数物理基准被评错,几乎全部饱和
inductionheads · x · 2026-09-15
新论文《How Good Are Frontier Models at Physics?》由耶鲁物理学家对现有基准进行专家重评,发现很多「失败」其实是基准题错了。
- 按现有基准,前沿模型物理表现不佳(如 GPT5.6-sol 在 Humanity's Last Exam 物理部分仅 47.3%),但这与物理学家实际使用体验不符
- 团队将模型被判「失败」的题目交由耶鲁物理学家重新评分,发现问题多出在基准本身而非模型
- 修正后,模型几乎在所有基准上饱和,包括 HLE 物理部分和 CritPt
结论:当前多数物理类评测基准已失效,不能再用它们衡量前沿模型能力。
「模型」频道最新
- 机制可解释性研究:双重下降是记忆与泛化的相变 — gordic_aleksa · 2026-09-15
- Polymarket 押注:Grok 5 年底前发布的概率仅 43% — Polymarket · 2026-09-15
- TabPFN-3.5 发布:支持时序与分组数据,推理最快提速 6 倍 — FrankRHutter · 2026-09-15
- 云模型跑分有了更好看的可视化浏览方式 — the3dwin · 2026-09-15
- Flam 自研模型矩阵曝光:26B MoE 首token仅30ms,主打印度语言 — testingcatalog · 2026-09-15
- OPEN-1B 发布:全球首个全流程可审计的 1.6B 模型训练 — benfielding · 2026-09-15