IMO 2026 测试显示 harness 能提分,但前沿模型仍领先一大截

pequalnp92 · reddit · 2026-07-26

这篇对多个 LLM 在 IMO 2026 上的表现做了比较,结论是:前沿模型几乎不受 harness 影响就能拿到接近满分,而对其他模型来说,编排方式会显著改变结果。

主要发现:

作者还指出,最难题目依然需要关键数学洞见,不是单靠检索或验证就能解决;另外,模型在可验证领域里仍会幻觉,例如 Sonnet 曾给出过错误解答,需要额外评分和人工复核来发现。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →