团队请 IMO/ICPC 决赛选手出题,实测 AI 评审数学证明的可靠性
karinanguyen · x · 2026-10-03
Repovive 举办首届数学竞赛后,与一支由 IOI、IMO、ICPC 决赛选手组成的团队合作,评估其 AI 评审判分能力。
做法:选出 534 份可疑或边缘的参赛提交,建立统一评分标准并制作专家参考判卷,再比较不同评分指令下的模型与专家判断的一致性。核心问题是:模型能否可靠地理解并核查高难度数学证明。作者提到在全部竞赛提交的完整集合上,准确率更高。
「模型」频道最新
- ExploitBench 成绩高度依赖 harness:GLM 5.3 Flash 表现远超 4.1 — teortaxesTex · 2026-10-03
- Meta Muse 质量下滑:推理过载致任务频繁掉落且不通知 — brandon_galang · 2026-10-03
- vLLM 开源 Decision 2.0 决策模型:单次前向答 64 问,最快 63ms — vllm_project · 2026-10-03
- 为何没人用顶级推文训练一个学会「高人思维」的模型? — Gauri_the_great · 2026-10-03
- Cloudflare 决策模型 Clef 上架 Ollama,可分类图片与工单路由 — ollama · 2026-10-03
- 「随机统计预测」是误解:模型内部存在被学到的算法结构 — burny_tech · 2026-10-03