反直觉测试:GPT-5.6 Luna中等档位在部分基准上反超Max
JeremyNguyenPhD · x · 2026-08-14
作者在测试中发现了一个反直觉的现象:虽然 GPT-5.6 Luna 的 Max 档位能力极强且几乎等同于无限使用,但在针对策略文档提供严谨、接地气回答的内部基准测试中,Medium 档位的表现反而更好。
这表明在特定需要更谨慎、克制回答的任务场景下,中等配置的模型可能具有意想不到的优势。
「模型」频道最新
- Agent 任务成本拆解:缓存与峰值费率致单次开销飙升 — teortaxesTex · 2026-08-14
- Meta AI 被批搜索能力拉胯:千亿美元算力像白砸了 — ivan_bezdomny · 2026-08-14
- 曝智谱 GLM-5.3 模型即将发布,已现身应用 — zephyr_z9 · 2026-08-14
- ICML论文揭示大模型记忆瓶颈:95%事实已学会,却有三成取不出 — 新智元 · 2026-08-14
- 吐槽前沿模型对齐过度:日常生产力任务令人血压飙升 — HanchungLee · 2026-08-14
- Anthropic 将于 10 月下架 Bedrock 上的 Claude 3.5 Sonnet — repligate · 2026-08-14