前沿物理基准 CritPt 最佳模型仅约 30% 分数,远未饱和

geoffwolfe · x · 2026-09-05

Artificial Analysis 的 CritPt 基准由 50 多位活跃物理研究者出题,包含 71 道未发表的前沿物理研究级挑战,覆盖 11 个物理子领域,每题平均经过 40+ 小时评审,采用抗猜测的答案格式(浮点数组、符号表达式、Python 函数)。2025 年头部模型在该基准上准确率只有个位数到约 30%,显示 AI 与研究级物理推理之间仍有巨大差距。

@anshuman1 补充:CritPt(30%)这类接近真实工作的基准远未饱和,而生物、化学、材料科学等领域的内部测试成绩更差。他正在参与 SciCode 基准,认为基准本身也需要改进,计划整理成 arXiv 短文发布。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →