多模型盲评实测:Opus 5 中档算力击败 4.8 高档夺魁

OHOLshoukanjuu · reddit · 2026-08-22

在一片「Opus 5 不行」的舆论中,一位非编程用户分享了自建的 Cross-Instance Review 盲评流程:让多个模型就同一简报独立起草,再用 STAR 投票(评分+自动决选)互评选出最佳底稿,用于生产其 Research Synthesis skill v2。

最终得分(满分30):Opus 5 Medium 以 30 分全票第一,Opus 4.8 High 25 分次之,决选 6–1 胜出;Fable 5 Medium(23) 击败 Fable 5 High(20);Opus 4.6 High 仅 8 分垫底,多位评审指出其漏掉具体需求。

两个反直觉发现:Fable 的 effort 档位效果呈反向(Medium 优于 High,已是第三次独立观察,没必要为 Fable 付 High 的钱);Opus 4.6 精确指令遵循弱,应从 build 席位中淘汰。作者还发现在多报告综合任务上 Sonnet 5 Low 因结果更稳定、成本更低反而优于 Opus 5。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →