CritPt 基准纠错后 GPT-5.6 pass@4 冲至 94.4%
bookwormengr · x · 2026-09-15
物理推理基准 CritPt 原始成绩显示顶级模型仅约 9–13% 起步,并随新模型发布在 30–32% 附近趋平。但一项新审计发现 56 道题中有 21 道存在基准错误。修复或剔除这些题目后,GPT-5.6 Sol 在修正版基准上 pass@4 达到 94.4%。虽然设置与官方榜单不可直接比较,但强烈表明物理-数学推理差距被高估了,前沿模型的物理推理能力可能远比原先认为的强。
「模型」频道最新
- Google 语音 AI 支撑 300+ 语言触达 70 亿人,再推新语言研究矩阵 — ymatias · 2026-09-16
- 工程师科普:RLHF 靠真人评估文本,各实验室多年如此 — JFPuget · 2026-09-16
- G2 数据:ChatGPT+Gemini 占 AI 研究市场 81%,Claude NPS 垫底 — sanderssays · 2026-09-16
- Prior Labs 发布 TabPFN-3.5:登顶两大榜单的表格基础模型,支持百万行数据 — tuanacelik · 2026-09-16
- 不输出文字只输出概率:新型基础模型速度 25 倍、成本降近 600 倍 — danshipper · 2026-09-16
- 书生 internlm 发布 Atria-Dawn 预览版:GLM MoE 架构开源模型登 HF 热榜 — internlm · 2026-09-16