个人实测基准:Opus 5.5 达 Fable 水平,GPT-5.6-Sol 仍居首
danshipper · x · 2026-09-23
Every 的 Dan Shipper 推荐 @hammermt 的个人基准 Mike's Checks(9 个模型、15 项真实工作任务)来看 Opus 5.5 的实战表现。
结果概览:Opus 5.5 总分 80%,多项任务达到 Fable 5(79%)水平,在 pptx、roleplay-interview 等任务上拿到 100%,但在部分任务上因运行超时未出分。榜首是 GPT-5.6-Sol(84%),Grok-4.6 也达 83%;DeepSeek-V4-Flash 仅 58%。
该基准的定位是回答「哪个模型最适合我的工作」,由脚本检查 + LLM 裁判打分,而非通用的模型能力宣称。
所属事件:Opus 5.5 全基准碾压 GPT-6 Sol,登顶 AA 智能指数(76 条相关)→
「模型」频道最新
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- 小米 MiMo-V2.6 公开 RL 训练:DeepSWE 从 58.4 冲至 72.57 — teortaxesTex · 2026-09-23
- steipete 调侃 Anthropic harness 封禁:只封流行的那些 — steipete · 2026-09-23
- Gemini 训练细节曝光:组级奖励重分配对抗 reward hacking — nrehiew_ · 2026-09-23
- 同一像素动画编程题横评:仅一个模型全程无干预跑通 — hullabaloo22 · 2026-09-23
- 用户实测称 Opus 5.5 用起来相当顺手 — Rasmic · 2026-09-23