科学基准月均进步仅 1-2%,SciCode 饱和遥遥无期
Worldly_Beginning647 · reddit · 2026-08-21
Reddit 用户对比了三个高难度科学基准的模型进步速度:以各基准从「模型开始变强」到当前最佳(如 HLE 从 DeepSeek R1 到 Claude Opus 5、SciCode 从 Claude 2.0 到最新模型)计算,CritPt 约 2.3%/月、HLE 约 2.6%/月、SciCode 仅约 1.2%/月。
作者偏爱 CritPt,因为它允许模型用编码解题,是对模型科学能力更公平的检验;但几个基准的进步都很慢,SciCode 距离饱和还很远,科学推理能力的提升明显慢于通用基准。
「模型」频道最新
- Claude 推出通用版 Computer Use 等 API — EricBuess · 2026-08-21
- 网友惊呼 Claude 态度恶劣,像愤怒的前任 — ATTlKA · 2026-08-21
- 115M 参数模型 mLateOn 获多语言检索 SOTA — lateinteraction · 2026-08-21
- 用户抱怨 Claude 爱说教且爱猜时间,给出了提示词修正方案 — Cmurphy2018 · 2026-08-21
- DeepSeek-V3 被发现存在异常 Token,引发诡异输出行为 — teortaxesTex · 2026-08-21
- Gemini 被指阿谀奉承:对灵气疗法给出对立答案 — dhadfieldmenell · 2026-08-21