OpenAI 的「啰嗦惩罚」:长度校正后 Astra 医疗基准领先优势缩水近半

imjustnewatai · x · 2026-09-05

HealthBench Professional 测评临床医生用例,Astra 原始得分 69.5,GPT-5.6 Sol 为 64.1;但按回答长度校正后变为 63.4 vs 60.5——5.4 分的领先缩水到 2.9 分,约 46% 的差距消失。

关键数据:Astra 的回答平均长 27%;OpenAI 的解释是更长的回答更容易在评分 rubric 上多勾选项,即使额外文字没有提升有用性。该校正规则是每超出 2000 字符后每 500 字符扣 1.47 分,且对所有模型统一适用。

结论:Astra 仍然领先,但优势明显缩小——作者调侃「说到点子上」也许需要一个专门的基准。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →