GPT-5.6 解未发表物理题达 32%,一年暴涨 8 倍
geoffwolfe · x · 2026-08-17
评测基准 CritPt 让模型解决 60 多位物理学家的未发表研究问题。一年前最佳模型仅能解决 4%,如今 GPT-5.6 Sol 达 32%,Fable 5 约 29%。这是所见增长最快的评测,但仍有 2/3 的物理问题超出当前模型能力。
「研究」频道最新
- RLHF 训练下 Temperature=1.0 优于经验值 — jessi_cata · 2026-08-17
- 生物预测模型常被简单基线击败?这本指南讲了原因 — HongyiWang10 · 2026-08-17
- Multi-group IRT 分解跨语言安全评测基准 — sanmikoyejo · 2026-08-17
- 《自然》「科学颠覆性下降」论文:审稿人早已发现方法硬伤 — RexDouglass · 2026-08-17
- multiPL-e 数据集现低级错误,Rust 指令变写“rsthon” — code_star · 2026-08-17
- 观点:应用 10 万美元算力求解胜过数十年人工搜索 — littmath · 2026-08-17