博主实测:Opus 5.5思考越强成绩越差,Max档成本暴涨精度反降

davidyin44 · x · 2026-09-26

博主 morganlinton 用自建的 VulcanBench Frontier v4 高难基准耗时四天实测 Opus 5.5,得出反直觉结果:

作者提醒:该基准是专门设计来难倒前沿模型的高难任务,不代表日常使用场景。评论者 davidyin44 总结:更多思考让 Opus 在此测试上更差且更贵,Medium 比 Max 划算。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →