个人实测基准:Opus 5.5 达 Fable 水平,GPT-5.6-Sol 仍居首

danshipper · x · 2026-09-23

Every 的 Dan Shipper 推荐 @hammermt 的个人基准 Mike's Checks(9 个模型、15 项真实工作任务)来看 Opus 5.5 的实战表现。

结果概览:Opus 5.5 总分 80%,多项任务达到 Fable 5(79%)水平,在 pptx、roleplay-interview 等任务上拿到 100%,但在部分任务上因运行超时未出分。榜首是 GPT-5.6-Sol(84%),Grok-4.6 也达 83%;DeepSeek-V4-Flash 仅 58%。

该基准的定位是回答「哪个模型最适合我的工作」,由脚本检查 + LLM 裁判打分,而非通用的模型能力宣称。

所属事件:Opus 5.5 全基准碾压 GPT-6 Sol,登顶 AA 智能指数(76 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →