MindTrial 实测:Sonnet 5.5 从 72 跳到 94/98,Opus 5.5 达 96
Correct_Tomato1871 · reddit · 2026-10-04
MindTrial 基准维护者在同一套 98 任务(39 文本 + 59 视觉,可用 Python/科学库,每任务 10 次调用上限)上实测了 Sonnet 5.5 和 Opus 5.5(均为 xhigh 档,无跳过任务):
| 模型 | 通过 | 硬错误 | 请求耗时 |
|---|---|---|---|
| Sonnet 5 | 72/98 | 6 | 5:30:44 |
| Sonnet 5.5 | 94/98 | 1 | 1:23:07 |
| Opus 5 | 88/98 | 4 | 3:40:24 |
| Opus 5.5 | 96/98 | 0 | 0:58:35 |
Sonnet 提升最大:多过 22 题,请求时间减少 74.9%,输出 token 减少 67.4%(含推理);新增 24 个通过(18 个原错答 + 6 个原报错),仅 2 题回退;第二视觉集从 12/26 升到 25/26。Opus 净增 8 题、耗时降 73.4%,零硬错误,仅剩数方块和圆片匹配两题失败。
工具调用层面喜忧参半:Sonnet 在 24 个任务中出现 41 次未定义变量错误(虽然 23 个有失败调用的任务最终仍通过);Opus 无此类错误,155 次 Python 调用仅 2 次非零退出。两模型的工具调用量均大降(Sonnet -55%,Opus -51%),显示 Sonnet 的高分仍有工具执行可靠性提升空间。对比 Astra high,Opus 仅多对 1 题(96 vs 95),但计入本地 Python 墙钟时间后 Astra 反而更快。
「模型」频道最新
- 爆料称 OpenAI「Bel」或 12 月发布,Anthropic 刚完成大规模预训练 — imjustnewatai · 2026-10-05
- X 用 Grok 重写实时回复审核指南,弃用 Perspective API — tetsuoai · 2026-10-05
- Qwen 模型幻觉出阿里云签名 URL,是训练痕迹还是数据外传? — PerfectOlive1324 · 2026-10-05
- 传 Opus 5.5 生成一张又哭又笑的脸,观感诡异走红 — repligate · 2026-10-05
- yacine 吐槽:Opus 幻觉更多,但 astra 是直接对我说谎 — yacineMTB · 2026-10-05
- SFT 复兴论文遭质疑:评测设置全无披露,单次采样数字近乎无意义 — hyunw_kim · 2026-10-05