IMO 2026 测试显示 harness 能提分,但前沿模型仍领先一大截
pequalnp92 · reddit · 2026-07-26
这篇对多个 LLM 在 IMO 2026 上的表现做了比较,结论是:前沿模型几乎不受 harness 影响就能拿到接近满分,而对其他模型来说,编排方式会显著改变结果。
主要发现:
- frontier models(sol、fable) 不管有没有 harness,都能做到接近满分
- Sonnet / Opus 在网页端表现较差,换成 provider harness(Claude Code)后变好,再接入作者自定义的多智能体 harness AutoFyn 后进一步提升
- 开权重模型 GLM 的无 harness 表现大致与 Sonnet 接近,也能从 AutoFyn 中获得类似增益
- 即便加上 harness,作者团队仍没法追上 frontier 模型
作者还指出,最难题目依然需要关键数学洞见,不是单靠检索或验证就能解决;另外,模型在可验证领域里仍会幻觉,例如 Sonnet 曾给出过错误解答,需要额外评分和人工复核来发现。
「编程与Agent」频道最新
- AI 编程工具的三道门槛:验证、MVP、生产化 — tristanbob · 2026-07-26
- LiveKit 新增 huddles,让人类和 agent 同场对话 — jasonkneen · 2026-07-26
- AI 编程助手先改上千行,最后承认只该动一点点 — xeophon · 2026-07-26
- Agent 做幻灯片生成要有严格 schema 和确定性回退 — Live-Purpose-641 · 2026-07-26
- AI 编码评测应展示性能、成本和耗时分布 — zainhas · 2026-07-26
- 官方 Obsidian CLI 指南:AI agent 可直接驱动知识库 — dSebastien · 2026-07-26