一项实验里训练 MSE 下降,真正外推误差却持续变差
suchenzang · x · 2026-08-04
这条帖子的重点不是“方法真的有效”,而是一个反讽:训练集上的指标变好,不代表真实推演也在变好。
被引用的结果里,随着 K 增大,训练目标上的 selected velocity MSE 确实下降了;但在真正的 held-out rollout 上,inference MSE 反而持续变差,说明方法更像是在优化训练指标,而不是提升实际表现。
「研究」频道最新
- LightParkour 将少量人类动作种子蒸馏成可部署人形跑酷策略 — CyberRobooo · 2026-08-04
- RL 研究者争论:Dyna 式系统该叫 model 还是 world model — tw_killian · 2026-08-04
- METR 用 NanoGPT 测出 AI 优化能力的“支出视界” — gleech · 2026-08-04
- Goodfire AI 正在拆解 LLM,研究它们如何思考 — Scobleizer · 2026-08-04
- Lightbot 0 学会跑酷式全身接触动作,面向救援场景 — CyberRobooo · 2026-08-04
- Lean 形式化 Mochizuki abc 证明,又卡在同一关键步骤 — MarioKrenn6240 · 2026-08-04