专家警告:Kaggle 公开榜成绩易过拟合,不代表真实水平
calabi_and_yau · x · 2026-08-13
针对近期声称在 Kaggle 多项竞赛中超越 89.5% 人类选手的 AI 模型 Locus,专家 Jean-François Puget 提出质疑。
他指出,目前竞赛仍在进行中,现有的分数仅来自公开排行榜。在公开榜单上爬分往往可以通过激进的过拟合来实现,但这并不能反映模型在最终隐藏测试数据上的真实表现。此外,所谓的“平均第四名”具有误导性,因为它只统计了参加所有竞赛的极少数人类选手,而这些选手往往并非顶尖参赛者。
「模型」频道最新
- Qwen3.8 发布在即,网友期待“僧侣模式”推理 — Ok-Shower7286 · 2026-08-13
- Qwen3.8-27B模型发布倒计时页面上线 — paf1138 · 2026-08-13
- Ramp 数据:Anthropic 企业采用率反超 OpenAI — rohanpaul_ai · 2026-08-13
- Qwen-Max跑分缩水?更新后分数从56降至53 — teortaxesTex · 2026-08-13
- 被指隐瞒结果,xAI模型安全报告出现多处缺失 — npinto · 2026-08-13
- Grok 4.6 性价比远超 Claude 3.5,API 成本仅其五分之一 — rohanpaul_ai · 2026-08-13