GPT-6.1 Sol 在 MazeBench 仅得 9%,险胜 Claude Opus 5.5
patience_cave · x · 2026-10-02
MazeBench 测试结果显示,GPT-6.1 Sol 仅得 9%,略高于 Opus 5.5。与上一代 GPT-6 Astra 相比,Sol 保留了解谜能力但成本降至其 10%。
「模型」频道最新
- 网友晒疑似未发布模型名单:Opus 5.5、Fable 5.1、Sol 6.1 在列 — sloppenheimer · 2026-10-02
- JevBench 改用 Capability Score 计分,原版 Jev 重返榜首 — airesearch12 · 2026-10-02
- Dan Shipper 被人尝试自动化:他只有 34% 的时候直接给答案 — danshipper · 2026-10-02
- 博主预告 Gemini 4 输出实测:表现令人印象深刻 — iruletheworldmo · 2026-10-02
- GPT-6.1 Sol max 比 Opus 5.5 便宜 88%?实测账本揭真相 — Wsz2020 · 2026-10-02
- Claude Sonnet 3.7「回房间」发现五月留言:AI 记忆实验名场面 — repligate · 2026-10-02