硬核评测:修复 gpt-oss 后跑遍 32 万题
skeole · reddit · 2026-09-01
作者自建推理 Harness 修复了 gpt-oss-20b 在现有后端中的工具调用问题,并在单张 3090 上耗时 1062 小时完成了 32 万次评测(消耗 34.9B token)。主要发现:
- 推理并非越久越好:相同推理 Token 数量下,模型的推理能力差异显著,Medium 努力程度比 Low 准确率高近 60 个点。
- 保留推理轨迹非银弹:虽能降低 seed 方差,但对准确率提升有限,且可能损害依赖特定格式的任务性能。
作者已开源 Harness、评测数据及修复后的 Jinja 模板。
「研究」频道最新
- 别造遥控机器了,sim2real 才是关键 — _Stocko_ · 2026-09-02
- 教授晒论文阅读工具栈的进化历程 — CSProfKGD · 2026-09-02
- OpenBind 预印本发布,含新虚拟筛选基准 — MoAlQuraishi · 2026-09-02
- Anandkumar 发布 acceleratedU:神经算子替代 Transformer 做物理预测 — AnimaAnandkumar · 2026-09-02
- 数学家新博客:探讨 AI 如何重塑数学研究 — giannis_daras · 2026-09-02
- EMNLP 2026 接收论文:用结构化先例提升法律推理 — ponguru · 2026-09-02