One Layer Deeper 上线:用一张 H100 测架构与优化器协同设计
marksaroufim · x · 2026-08-04
One Layer Deeper 竞赛正式上线,核心问题是:模型能不能学会把更多算力花在更难的问题上。
主办方认为,很多优化器 benchmark 默认模型“本来就能训练好”;而这次竞赛要求参赛者把 架构、优化器、损失函数和训练设置一起设计。
页面里给出的关键规则包括:
- 只允许 一个文件、一个 H100、一个固定的模型状态上限
- 训练预算可以自由分配
- 最终只看一个总分
- 任务是重复模幂:x^(2^T) mod N
- 当前排行榜上有 16 个参赛者,全部还停留在 T=1
这个项目本质上是在测试:架构-优化器协同设计 能否支持自适应计算,以及更强的测试时推理。
所属事件:Tilde 发起 One Layer Deeper 竞赛探索模型深度计算(3 条相关)→
「研究」频道最新
- LightParkour 将少量人类动作种子蒸馏成可部署人形跑酷策略 — CyberRobooo · 2026-08-04
- RL 研究者争论:Dyna 式系统该叫 model 还是 world model — tw_killian · 2026-08-04
- METR 用 NanoGPT 测出 AI 优化能力的“支出视界” — gleech · 2026-08-04
- Goodfire AI 正在拆解 LLM,研究它们如何思考 — Scobleizer · 2026-08-04
- Lightbot 0 学会跑酷式全身接触动作,面向救援场景 — CyberRobooo · 2026-08-04
- Lean 形式化 Mochizuki abc 证明,又卡在同一关键步骤 — MarioKrenn6240 · 2026-08-04