反直觉测试:GPT-5.6 Luna中等档位在部分基准上反超Max

JeremyNguyenPhD · x · 2026-08-14

作者在测试中发现了一个反直觉的现象:虽然 GPT-5.6 Luna 的 Max 档位能力极强且几乎等同于无限使用,但在针对策略文档提供严谨、接地气回答的内部基准测试中,Medium 档位的表现反而更好。

这表明在特定需要更谨慎、克制回答的任务场景下,中等配置的模型可能具有意想不到的优势。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →