COLM'26 三篇论文:自对弈基准 MathDuels 让评测难度随模型共进化
AI4Code · x · 2026-10-08
作者带学生参加旧金山 COLM'26,展示三篇论文:
- MathDuels: A Self-Play Benchmark That Grows:针对静态数学基准接近天花板、无法区分模型能力的问题,让模型同时扮演出题者与解题者。三阶段生成管线(元提示、出题、难度放大)产出对抗性题目,独立验证器剔除病题,用 Rasch 模型联合估计解题能力与题目难度。19 个前沿模型实验显示:出题与解题能力部分解耦,双角色评测能揭示单角色基准看不到的能力差距;新模型入场会出题击败旧霸主,难度随参与者共同进化而非饱和,并维护公开排行榜。
- Detecting Safety Violations Across Many Agent Traces:跨大量 agent 轨迹检测安全违规。
- Do We Need Frontier Models to Verify Mathematical Proofs?:探究数学证明验证是否需要前沿模型。
「漫话AGI」频道最新
- OpenAI 纳维-斯托克斯突破的启示:数千智能体协同探索 — cneuralnetwork · 2026-10-08
- 可能的心智空间没 EY 想的那么宽?对正交性论题的新质疑 — jd_pressman · 2026-10-08
- OpenEvidence 8 月被医生使用 4200 万次,但独立评估仍缺席 — dr_alphalyrae · 2026-10-08
- rationalist AI 末日文献里老冒出外星人,遭吐槽 — ZeroStateReflex · 2026-10-08
- Linear CEOKarri Saarinen:离开 AI 潮流数月后发现行业并未真正改变 — lennysan · 2026-10-08
- LeCun 以直升机百年史类比 AI:想出点子容易,做成产品最难 — rsalakhu · 2026-10-08