推理模型学习困难?Tilde 研究团队发起 One Layer Deeper 竞赛
AashaySachdeva · x · 2026-08-23
Tilde 研究团队发布博客,探讨当前推理模型通过生成更多 token 来扩展顺序计算的限制。这种方法强制某些中间计算通过生成的 token 而非完全在模型的潜在状态内更新,可能人为地串行化本可以并行执行的计算。博客提出替代架构可以通过增加潜在深度来扩展计算,但这类模型往往更难训练。团队宣布发起 "One Layer Deeper" 竞赛(截至 2026 年 8 月 31 日),研究架构、目标和优化器是否可以共同设计来学习更深的串行计算,并训练中见过的推理深度之外进行有意义的推断。竞赛将使用重复模块平方作为公开任务。
「研究」频道最新
- 研究:错误配置的 Admin 提示可击穿安全层 — Simple_Passion_7741 · 2026-08-23
- 7500 行代码教你从零训练现代语言模型 — tom_doerr · 2026-08-23
- ProteinDPO 用偏好对齐解决蛋白模型对齐问题 — bravo_abad · 2026-08-23
- 文章解析从形式语义到知识图谱与 Agent 的演进 — adnan_hashmi · 2026-08-23
- 开源 Roguelike 游戏 DelveRL 专为训练游戏 AI 打造 — SnyderConsulting · 2026-08-23
- 首个代码库级形式化验证基准 Vero 发布 — dawnsongtweets · 2026-08-23