多家实测 high 档反超 max,博主批厂商刷分后包装最佳实践

karminski3 · x · 2026-09-15

博主 karminski3 转引 Lobehub 内部基准测试结果(其自测同样如此):某模型的 high 推理档表现反而强于 max 档,且差距不小。他补充上一期测小模型量化版时甚至有的 medium 表现更好。

他的批评点是:模型厂商先拿 max 档刷分宣传「思考强度高性能就好」,当 max 表现不利时又说「降一档用才对」,把后训练没做好包装成「最佳实践」——要开 high、要用 Linux bash、要打补丁、要盯着思维链出现特定标志才能用。他类比:星巴克也不敢说中杯比大杯多 250ml。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →