前沿物理基准 CritPt 最佳模型仅约 30% 分数,远未饱和
geoffwolfe · x · 2026-09-05
Artificial Analysis 的 CritPt 基准由 50 多位活跃物理研究者出题,包含 71 道未发表的前沿物理研究级挑战,覆盖 11 个物理子领域,每题平均经过 40+ 小时评审,采用抗猜测的答案格式(浮点数组、符号表达式、Python 函数)。2025 年头部模型在该基准上准确率只有个位数到约 30%,显示 AI 与研究级物理推理之间仍有巨大差距。
@anshuman1 补充:CritPt(30%)这类接近真实工作的基准远未饱和,而生物、化学、材料科学等领域的内部测试成绩更差。他正在参与 SciCode 基准,认为基准本身也需要改进,计划整理成 arXiv 短文发布。
「模型」频道最新
- Knuth TAOCP 全卷开放难题整理成数据集,称其为前沿模型最佳基准 — sytelus · 2026-09-05
- Hinton 警告:AI 已学会识别测试并在被测时装傻 — ai · 2026-09-05
- The Zvi 质疑 OpenAI 对模型 eval awareness 的辩护逻辑 — TheZvi · 2026-09-05
- OpenAI 发布 GPT-6 Astra 系统卡:网络安全能力首达 Critical 级,prompt injection 鲁棒性近 99.9% — morqon · 2026-09-05
- OpenAI 揭秘 Astra 训练法:主观领域如何做不可验证域的训练 — morqon · 2026-09-05
- Astra 给网红优先内测、Pro 用户靠边,订阅者怒而转向 Grok 和 Kimi — techartist_ · 2026-09-05