网传 Claude Opus 5 无工具拿下 2026 IMO 满分

社交平台近期热传 Anthropic 的下一代模型 Claude Opus 5 在 2026 年国际数学奥林匹克(IMO)中拿下了 42/42 的满分。这一消息引发了 AI 社区对大模型数学推理能力及现有基准测试有效性的广泛关注。

已确认

目前可以确认的是社交平台上的信息传播情况:流传的评测报告截图声称 Claude Opus 5 拿到了 42/42 满分。据帖子描述,该测试没有使用 agent harness 或任何外部工具。模型对 6 道题目各生成了四份独立解答,随后由三位评估者进行打分。此外,帖子作者 @davidwromero 补充称,有 6 份解答被 GPT 5.6 判断为正确,并附上了原始的推理轨迹。

尚未确认

该评测结果本身的真实性与权威性目前尚无法确认。2026 年 IMO 尚未举办,这表明测试大概率使用的是泄露的、模拟的或内部生成的题目。此外,该评测的发起方、三位评估者的具体身份以及评分流程的严谨程度均未明确,GPT 5.6 等模型作为评判标准也缺乏官方背书。

为什么重要

如果该测试结果属实,这将成为 AI 模型在高难度、强筛选数学题上极具统治力的表现。转发者 @surmenok 等人认为,这表明现有的高难度数学基准测试已经“彻底饱和”,未来可能需要设计更具挑战性的评估体系来衡量 AI 的真实能力上限。

2026-07-25 ~ 2026-07-26 · 5 条相关

一手来源

另有 1 条近重复转述:surmenok