厂商回应刷榜质疑:新榜单公私集差距小,称增强非 benchmaxxing
antoine_chaffin · x · 2026-10-07
antoinechaffin(被转发点赞为「榜单高分与科学标准双守门人」)回应 benchmaxxing 质疑:其模型在新发布的全新排行榜上保持 top-1,且公私有划分之间的差距很小——「有些模型在私有集上崩了,我们的没有」。他以公开/私有集表现差作为模型增强并非针对榜单过拟合的证据。原帖未指明具体模型与榜单细节。
所属事件:Decider 模型作者回应刷榜质疑:公私榜差距极小(3 条相关)→
「模型」频道最新
- 观察:西方实验室更少从 Claude 蒸馏,却更倾向蒸馏 GLM 5.3 — andrew_n_carr · 2026-10-07
- OpenAI Luna 后开源模型性价比讨论遇冷,博主自嘲用 GPU 余热取暖 — BLUECOW009 · 2026-10-07
- V4.1 Flash 评测:Flash 梯队最强,但幻觉忽好忽坏像开盲盒 — teortaxesTex · 2026-10-07
- OpenAI 推出 Decisions API,快速决策比 GPT-6 Luna 快 10 倍 — stevenheidel · 2026-10-07
- OpenAI 将在欧盟默认给 ChatGPT 输出水印,应对 AI 法案 — Ars Technica AI · 2026-10-07
- Mistral 用 3800 块 Grace Blackwell GPU 在欧洲训练 ML4,新集群即将上线 — rakyll · 2026-10-07