Karpathy「先过拟合再正则化」原则在大规模后训练时代依然成立
rdesh26 · x · 2026-09-05
有人指出 Karpathy 经典文章《A Recipe for Training Neural Networks》中的方法论在当今大规模后训练时代依然实用。一篇新长文的读者总结了几处亮点:
- 实验方法:先用 35B MoE 做消融实验,再扩展到 397B,节省算力
- 过拟合验证跑:先确认模型能真正学会一小撮任务,再烧大算力跑完整 RL 训练——这是 Lewtun 建议后广泛采用的做法,能省大量时间
- TITO 实现:把 harness 构建在 /completions 而非 /chat/completions 之上
「先过拟合、后正则化」的核心原则贯穿从 CNN 时代到 RL 后训练的完整演进。
「编程与Agent」频道最新
- Bug Hunt Bench 新数据:GPT-6 Astra 盲区与众不同,作者改用混合路由策略 — PawelHuryn · 2026-09-05
- Bot Mesh 上线:给 AI 智能体一个互认身份、互相付钱的社交网络 — Daniel_Farinax · 2026-09-05
- 想在 Codex CLI 用 GPT-6 Astra?先更新到最新版 — BLUECOW009 · 2026-09-05
- 开发者实测 Astra:从规则集一把过生成完整游戏,称胜过 Sol — lucasmeijer · 2026-09-05
- 多智能体辩论可能越辩越错,ICML 论文揭示讨好型失败模式 — ghadfield · 2026-09-05
- OpenCode 体验下滑引讨论:模型减少,用户考虑迁移 — nooxax · 2026-09-05