CritPt 物理基准测 LLM 研究力,满分率升至 30%
geoffwolfe · x · 2026-08-24
ReasonCore 发布了 CritPt(Critical Point),一个专门测试前沿 LLM 物理研究能力的基准。该基准由 50 多位物理学家基于未发表论文编写了 71 个研究级挑战,旨在考察模型处理综合推理任务而非孤立知识点的能力。
- 设计特点:问题无法死记硬背,答案为数值数组或 Python 函数等可机器验证格式,避免了 LLM-as-judge 的主观性。
- 评测结果:发布时最佳模型得分仅 5.7%,不到一年后顶级模型分数接近 30%。
- 结论:虽然进展迅速,但仍有 70% 的领域未被攻克,揭示了模型在持续、集成式推理方面的短板。
「研究」频道最新
- 特斯拉 FSD 技术揭秘:改用端到端视频模型,模仿人类学习 — PTrubey · 2026-08-24
- 实战:用 RL 自我进化设计芯片,Kimi K3 跑出 87000 tps — brianryhuang · 2026-08-24
- 预测会改变现实:Manheim 引 Popper「俄狄浦斯效应」谈自我实现预言 — davidmanheim · 2026-08-24
- 优化评测应修复评测而非构建合成环境 — xeophon · 2026-08-24
- 论文提出 MoE 模型高效超参数迁移框架 — kakaocorp · 2026-08-24
- 研究揭示 LLM 在线蒸馏的泛化双重性 — IQuestLab · 2026-08-24