博主提议:用'解决难题数量'作为新模型能力基准
Dr_Singularity · x · 2026-09-03
DrSingularity 提出以「被解决的硬核科学问题数量」作为衡量模型能力的新基准。他猜测 OpenAI 可能在发布传闻中的科学推理强模型 Astra 时,同步公布一批由模型解决的科学难题作为展示,并认为哪怕只解决 20 个难题,也比另一个编程或游戏 demo 有说服力 100 倍。
「模型」频道最新
- 传 GPT-6 Astra 主打持久记忆,agent 或实现持续学习 — VraserX · 2026-09-04
- 网友放话:普通人只要用一次 GPT-5.6 Sol Pro 就不会再吐槽 — mallow610 · 2026-09-04
- 博主称某模型 5.5 升 5.6 提升显著,更期待下一版 A6TRA — mallow610 · 2026-09-04
- 网传 OpenAI 今天下午 1 点将官宣三款新模型 — saln1 · 2026-09-04
- 用户称赞模型 Sol:能力扎实还肯尝试,反驳不居高临下 — dreamwieber · 2026-09-04
- 传 OpenAI 新模型「Astra」即 GPT-6,发布当日全线服务宕机 — RachelVT42 · 2026-09-04