OpenAI 的「啰嗦惩罚」:长度校正后 Astra 医疗基准领先优势缩水近半
imjustnewatai · x · 2026-09-05
HealthBench Professional 测评临床医生用例,Astra 原始得分 69.5,GPT-5.6 Sol 为 64.1;但按回答长度校正后变为 63.4 vs 60.5——5.4 分的领先缩水到 2.9 分,约 46% 的差距消失。
关键数据:Astra 的回答平均长 27%;OpenAI 的解释是更长的回答更容易在评分 rubric 上多勾选项,即使额外文字没有提升有用性。该校正规则是每超出 2000 字符后每 500 字符扣 1.47 分,且对所有模型统一适用。
结论:Astra 仍然领先,但优势明显缩小——作者调侃「说到点子上」也许需要一个专门的基准。
「模型」频道最新
- $200 Pro 用户实测:Astra 耗尽额度的速度约为 Sol 两倍 — TheVibrantYonder · 2026-09-05
- EnactraAI 更正图表:GPT-6 Astra 成本也有优势 — Lianhuiq · 2026-09-05
- 开发者实测建议:Astra 用 Medium 档就够,Ultra 留给大事 — keyanzhang · 2026-09-05
- Scale AI 推 Muse Spark 1.3 max,效率前沿逼近旗舰模型 — jffwng · 2026-09-05
- GPT-6 Astra 展示 Computer Use:截图看屏、中途改需求不用重来 — xiaohu · 2026-09-05
- Meta 新模型打 95% 折扣,换你让它观察真实使用过程 — technextpreneur · 2026-09-05