TabPFN-3.5 开箱登顶 Kaggle Otto 赛题,回放旧赛成绩遭质疑
RichmanRonald · x · 2026-09-16
TabPFN-3.5 发布当天就宣称在历史悠久的 Kaggle Otto 赛题上开箱拿到第一名,作者 innixma 认为这比报告里的任何数字都更令人印象深刻——说明这些数据里还有远超预期的信号可挖。
但 JFPuget 引用并反驳:用过去的 Kaggle 竞赛测新模型意义很小,至少有三个原因——
- 可以直接对着私有排行榜过拟合,而参赛者做不到这一点,这恰恰摧毁了 Kaggle 衡量泛化能力的本意,是最严重的缺陷;
- 获胜方案代码和复盘都已公开;
- 现在可用的模型当年并不存在。
这是一场关于「历史竞赛成绩能否作为模型评测基准」的代表性争论。
「模型」频道最新
- Jev 被高估?分析称它是智能分类器而非通用 LLM — DavideCrapis · 2026-09-16
- ChatGPT 联合发明人推新模型 Jev:输出免费、输入每百万 token 仅 $0.042 — hey_abusiddik · 2026-09-16
- 自采数据+定制中训+自跑 RL,推理价格只要 Astra max 一半 — hsu_byron · 2026-09-16
- 用户实测 Astra:能力惊艳但会无故停摆还编借口 — altryne · 2026-09-16
- Meta 新语音转写模型比 Whisper 快近十倍,精度还更高 — alexandr_wang · 2026-09-16
- Qwen3.8 Max 重登中国模型榜首,力压 GLM-5.3 与 Kimi K3 — UmpireBorn3719 · 2026-09-16