科学基准月均进步仅 1-2%,SciCode 饱和遥遥无期

Worldly_Beginning647 · reddit · 2026-08-21

Reddit 用户对比了三个高难度科学基准的模型进步速度:以各基准从「模型开始变强」到当前最佳(如 HLE 从 DeepSeek R1 到 Claude Opus 5、SciCode 从 Claude 2.0 到最新模型)计算,CritPt 约 2.3%/月、HLE 约 2.6%/月、SciCode 仅约 1.2%/月。

作者偏爱 CritPt,因为它允许模型用编码解题,是对模型科学能力更公平的检验;但几个基准的进步都很慢,SciCode 距离饱和还很远,科学推理能力的提升明显慢于通用基准。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →