DiscoverPhysics:22个偏离真实物理的世界,考住最强LLM智能体
burny_tech · x · 2026-09-26
一个叫 DiscoverPhysics 的交互式 benchmark 想回答一个问题:LLM 是真的会科学推理,还是只是背下了已有物理学?
- 基准用 N-body 模拟器按需生成 22 个物理规律被刻意改动的世界:屏蔽引力、分数幂引力、多物种耦合、隐藏的暗物质式粒子、时变相互作用等
- 智能体需要多轮提出实验、观察原始轨迹数据,最后提交自然语言的物理解释 + 用 Python 实现的物理定律
- 评测双轴:held-out 粒子的轨迹 MSE + 按专家 rubric 打分的解释质量
- 关键发现:11 个前沿模型中,最强的智能体也只能通过约一半的世界
因为解出一个世界需要设计有信息量的实验并迭代修正假设,这个基准考察的是跨越完整实验历史的长程推理,而单靠记忆已有科学无法通过。作者团队包括 Andrew Gordon Wilson、Pavel Izmailov 等人,论文已挂 arXiv。
「研究」频道最新
- SREGym 获 NeurIPS 2026 接收:为生产运维智能体补上基准空白 — tianyin_xu · 2026-09-26
- NBER 论文:计入质量与激励因素后,中国 AI 专利领先或为虚象 — avicgoldfarb · 2026-09-26
- NBER 会议开幕聚焦 AI 驱动创新:中美创新均在加速 — avicgoldfarb · 2026-09-26
- 宝可梦智能体基准 PokéAgent Challenge 入选 NeurIPS 2026 — Vjeux · 2026-09-26
- LLM 自主发现数学定理,趣味性指标提升 4.3 倍 — CatAstro_Piyush · 2026-09-26
- Claude 无监督跑数天,粒子物理散射振幅计算首破九圈纪录 — AnthropicAI · 2026-09-26