多家实测 high 档反超 max,博主批厂商刷分后包装最佳实践
karminski3 · x · 2026-09-15
博主 karminski3 转引 Lobehub 内部基准测试结果(其自测同样如此):某模型的 high 推理档表现反而强于 max 档,且差距不小。他补充上一期测小模型量化版时甚至有的 medium 表现更好。
他的批评点是:模型厂商先拿 max 档刷分宣传「思考强度高性能就好」,当 max 表现不利时又说「降一档用才对」,把后训练没做好包装成「最佳实践」——要开 high、要用 Linux bash、要打补丁、要盯着思维链出现特定标志才能用。他类比:星巴克也不敢说中杯比大杯多 250ml。
「模型」频道最新
- 博主直播用 GPT-6 Astra xHigh 挑战《杀戮尖塔 2》目标赢一局 — Jsevillamol · 2026-09-15
- OpenAI 千禧年大奖解法陷数据污染争议,研究者称「我不信他们的否认」 — QuintinPope5 · 2026-09-15
- Matthew Berman 演示 GPT-6 用纯文本搭建整座城市 — Matthew Berman · 2026-09-15
- Reddit 用户实测:Muse Glimmer 本地模型自然对话体验惊艳 — New-Pressure-6932 · 2026-09-15
- 发帖人称 Astra 生成 SVG 能力极强,热热闹闹中被忽视 — krzonkalla · 2026-09-15
- 孪生素数界从246推进到188,GPT-6 Astra发布前夕再推至186 — RexDouglass · 2026-09-15