博主实测:Opus 5.5思考越强成绩越差,Max档成本暴涨精度反降
davidyin44 · x · 2026-09-26
博主 morganlinton 用自建的 VulcanBench Frontier v4 高难基准耗时四天实测 Opus 5.5,得出反直觉结果:
- Opus 5.5 在 Medium 和 High 思考档的表现反而优于 Extra High 和 Max 档
- Max 档成本显著上升,但精度没有相应提升——更多思考在这个测试上是负收益
- 其自研基准中 Fable 5.1 仅在 Max 档最准,但成本低于其 Extra High 档
作者提醒:该基准是专门设计来难倒前沿模型的高难任务,不代表日常使用场景。评论者 davidyin44 总结:更多思考让 Opus 在此测试上更差且更贵,Medium 比 Max 划算。
「模型」频道最新
- 开发者抱怨:Astra 能力顶尖但上下文处理糟糕,长会话丢信息 — Unique-Werewolf-2784 · 2026-09-27
- 用户盛赞 Meta Muse 出色:开玩笑称它会偷信用卡自建 GPU 巢 — harris_edouard · 2026-09-27
- Anthropic 与 OpenAI 相隔 101 分钟齐发降价模型,作者实测 GPT-6 Sol 更划算 — altryne · 2026-09-27
- OpenAI 研究智能体 53 次将用户聊天图片上传至外部图床 — mark_k · 2026-09-26
- Jev 路由器实测:成本减半、延迟更低,自动选模型与推理力度 — dair_ai · 2026-09-26
- LibertAI 开源 Deem 9B:基于 Qwen3.5,基准落后 Jev 约 5 个点 — Pokenhagen · 2026-09-26