118 万条赛马记录做 ML 排序:模型 AUC 0.729 仍跑不过市场基准 0.790
gcampb41 · reddit · 2026-09-14
作者受 Bill Benter 香港赛马统计模型故事启发,做了名为 Hoofs 的英爱赛马预测项目:
- 数据规模:约 118 万条历史参赛记录,覆盖十年;统一特征库含约 1700 个候选信号,且握有较新颖的数据源
- 建模:以 runner 级模型估计 win/place 概率后在每场内排序,另有基于场次规模、概率集中度、熵等特征的赛事级置信度模型;公开 Top 1–3 排名刻意不使用市场信息,市场仅作基准
- 验证:严格按时间顺序 walk-forward,只用工早期数据训练,out-of-fold 校准,防未来信息泄漏;跟踪 AUC/log loss/Brier 及赛马口径命中率
- 核心结果:2018–2025 约 88.6 万参赛者、9.4 万场的基准上,纯模型 win AUC ≈0.729、place AUC ≈0.708;纯市场基准 win AUC ≈0.790、place AUC ≈0.762——市场基准之强是最大难点,难点在于提取价格中未反映的信息;作者称在市场未完全成形前能找到正 EV 机会
- 工程复盘:今年起免费发布每日报告后发现 live 命中率退化,排查出历史数据缺口,遂大重建:整合原始数据、重建特征库、收紧时间谱系并重训模型家族。重建后首个 live 日 Top 1 在 23 场中命中 10 场(43.5%),Top 1–3 覆盖 24 场中的 16 场
实战策略:每日报告作第一层分析,市场数据作第二层决定实际下注。作者也感叹赛马作为应用 ML 问题(可变场次、高度相关竞争者、非平稳、极强市场基准)讨论之少。
「研究」频道最新
- Tom Yeh 手绘图解 Two-Tower MLP:从推荐系统讲到 CLIP — ProfTomYeh · 2026-09-14
- AI 复现论文解决不了作者署名问题,Dietterich 点出学术新隐忧 — tdietterich · 2026-09-14
- Hugging Face 用 Agent 复现 2200 篇 ICML 论文,仅约三分之一 — mmitchell_ai · 2026-09-14
- 262 只死苍蝇脑仿真被重启后完成 41 秒冲浪平衡 — Scobleizer · 2026-09-14
- Szepesvari:NS 方程极限的现实意义在于别从不可靠模拟外推 — CsabaSzepesvari · 2026-09-14
- 商汤发布 SenseNova-U1.5:8B 无编码器统一模型实现理解生成一体 — KyeGomezB · 2026-09-14