50 余位专家重批物理基准:多数错误来自题目与评分,前沿模型接近饱和
zainhas · x · 2026-09-16
一篇 arXiv 论文(50+ 位作者,含多位物理学教授)复核了前沿 LLM 的物理能力评估:
- 主流物理基准(含 Artificial Analysis Intelligence Index 2026 收录的)低分让外界以为模型物理推理差,但与领域专家的实际体验不符
- 团队评估了六个广泛使用的物理基准,并请专家重新批改
- 结论:大量「模型错误」实际是基准题目错误或评分(grader)错误,而非模型本身不会
- 多个基准已接近饱和,当前的评测体系无法可靠区分前沿模型
作者戏称「错误来自评测内部」——先修好尺子,再谈模型强弱。
所属事件:耶鲁学者重评物理基准:前沿模型几乎全部饱和(2 条相关)→
「模型」频道最新
- OpenRouter 用户上周 OpenAI 消费反超 Anthropic,2.5 年来首次 — firstadopter · 2026-09-16
- 研究发现知识蒸馏在 mid-training 阶段牺牲事实记忆换推理 — LukeZettlemoyer · 2026-09-16
- DoorDash 等改用中国开源模型,闭源查询占比降至四分之一 — carlbfrey · 2026-09-16
- 阶跃星辰发布 StepAudio 3:5 款音频模型,ASR 达 1.7% WER — StepFun_ai · 2026-09-16
- 开源模型扛不住生产负载?Smaug Flash 称已修复卡死问题 — bindureddy · 2026-09-16
- ChatGPT 语音卡顿、Codex 报错,AGI 前的可靠性短板凸显 — koltregaskes · 2026-09-16