公开榜与私榜差距极小,作者以此证明模型未刷榜
antoine_chaffin · x · 2026-10-07
antoinechaffin 回应「benchmaxxing」质疑:其模型不仅在新榜单上保持 top-1,公开与私榜(private split)的差距也非常小,说明成绩真实泛化而非针对公开测试集优化。他写道「有些模型在私榜上崩了,我们的纹丝不动」。
所属事件:Decider 模型作者回应刷榜质疑:公开私榜差距极小(2 条相关)→
「模型」频道最新
- 「Astra 暂停综合征」刷屏:steering 或致模型沉默,OpenAI 有解法 — thursdai_pod · 2026-10-07
- 网传 Qwen4 Flash 疑为 400B 参数,规模对标 GLM 5.3 Flash — EAccelerate_42 · 2026-10-07
- Anthropic 扩大网络安全验证计划,分三级开放攻击性用途权限 — EricBuess · 2026-10-07
- Mistral Large 4.0 万亿参数开源权重月底发布 — cpldcpu · 2026-10-07
- Claude 以「推理抽取」为由拒绝展示思考过程,用户吐槽:推理才是好东西 — StewartalsopIII · 2026-10-07
- 网友吐槽 Grok 性格拧巴:先说 No 再替你把论证讲得更强 — gandamu_ml · 2026-10-07