博主提议:用'解决难题数量'作为新模型能力基准

Dr_Singularity · x · 2026-09-03

DrSingularity 提出以「被解决的硬核科学问题数量」作为衡量模型能力的新基准。他猜测 OpenAI 可能在发布传闻中的科学推理强模型 Astra 时,同步公布一批由模型解决的科学难题作为展示,并认为哪怕只解决 20 个难题,也比另一个编程或游戏 demo 有说服力 100 倍。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →