多模型盲评实测:Opus 5 中档算力击败 4.8 高档夺魁
OHOLshoukanjuu · reddit · 2026-08-22
在一片「Opus 5 不行」的舆论中,一位非编程用户分享了自建的 Cross-Instance Review 盲评流程:让多个模型就同一简报独立起草,再用 STAR 投票(评分+自动决选)互评选出最佳底稿,用于生产其 Research Synthesis skill v2。
最终得分(满分30):Opus 5 Medium 以 30 分全票第一,Opus 4.8 High 25 分次之,决选 6–1 胜出;Fable 5 Medium(23) 击败 Fable 5 High(20);Opus 4.6 High 仅 8 分垫底,多位评审指出其漏掉具体需求。
两个反直觉发现:Fable 的 effort 档位效果呈反向(Medium 优于 High,已是第三次独立观察,没必要为 Fable 付 High 的钱);Opus 4.6 精确指令遵循弱,应从 build 席位中淘汰。作者还发现在多报告综合任务上 Sonnet 5 Low 因结果更稳定、成本更低反而优于 Opus 5。
「模型」频道最新
- 研究者实测:ChatGPT Ultra 长任务表现已超越 Pro 模式 — arankomatsuzaki · 2026-08-24
- 吐槽Google:Gemini 3.7发布一周仍未接入自家Jules智能体 — brandon_galang · 2026-08-24
- Qwen 27B 3.8 极低量化实测:Q3 XXS 可用 — jeremyckahn · 2026-08-24
- 用户反馈 GPT-5.6 近期输出质量显著变化 — haider1 · 2026-08-24
- Ramp 统计 Anthropic 模型使用占比:Opus 4.8 最受青睐 — vista8 · 2026-08-24
- 腾讯发布 UI-Mate-27B,支持桌面 GUI 智能体操作 — tencent · 2026-08-24