MindTrial 实测:Sonnet 5.5 从 72 跳到 94/98,Opus 5.5 达 96

Correct_Tomato1871 · reddit · 2026-10-04

MindTrial 基准维护者在同一套 98 任务(39 文本 + 59 视觉,可用 Python/科学库,每任务 10 次调用上限)上实测了 Sonnet 5.5 和 Opus 5.5(均为 xhigh 档,无跳过任务):

| 模型 | 通过 | 硬错误 | 请求耗时 |

|---|---|---|---|

| Sonnet 5 | 72/98 | 6 | 5:30:44 |

| Sonnet 5.5 | 94/98 | 1 | 1:23:07 |

| Opus 5 | 88/98 | 4 | 3:40:24 |

| Opus 5.5 | 96/98 | 0 | 0:58:35 |

Sonnet 提升最大:多过 22 题,请求时间减少 74.9%,输出 token 减少 67.4%(含推理);新增 24 个通过(18 个原错答 + 6 个原报错),仅 2 题回退;第二视觉集从 12/26 升到 25/26。Opus 净增 8 题、耗时降 73.4%,零硬错误,仅剩数方块和圆片匹配两题失败。

工具调用层面喜忧参半:Sonnet 在 24 个任务中出现 41 次未定义变量错误(虽然 23 个有失败调用的任务最终仍通过);Opus 无此类错误,155 次 Python 调用仅 2 次非零退出。两模型的工具调用量均大降(Sonnet -55%,Opus -51%),显示 Sonnet 的高分仍有工具执行可靠性提升空间。对比 Astra high,Opus 仅多对 1 题(96 vs 95),但计入本地 Python 墙钟时间后 Astra 反而更快。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →