拆解测试时训练(TTT):消融实验揭示最优组件配置
burny_tech · x · 2026-08-10
论文《Modular TTT》提出了一种模块化的测试时训练框架,将内部学习器表示为有向无环图,并将快权重网络、损失函数、学习率等作为独立的设计维度。
基于该框架,作者进行了系统的消融实验,得出以下关键发现:
- 小学习率初始化、权重衰减和单层非线性有助于提升性能。
- MSE 损失与内积损失表现相似。
- 更深的快权重网络和归一化会因激活值过大而损害性能。
- 残差连接和门控机制几乎没有明显收益。
基于上述发现,作者训练了 410M 和 1.45B 参数的模型,其训练损失和基准测试表现与 Gated DeltaNet 相当。
所属事件:字节跳动提出 Modular TTT 框架(2 条相关)→
「研究」频道最新
- Boltzbit 预告论文:BAST 架构称 LLM 学习速度可达 SOTA 千倍 — jmhernandez233 · 2026-09-22
- MiMo v2.6 用 GRS 与 GAR 重定义 RL 里的「好答案」 — tokenbender · 2026-09-22
- MiMo v2.6 环境合成:真实场景打底、多种 harness 并训 — tokenbender · 2026-09-22
- CodeMidas 源码驱动合成与 agent 长程任务合成的看点 — tokenbender · 2026-09-22
- 小米 MiMo v2.6 发布:RL 三要素扩规模成最大亮点 — tokenbender · 2026-09-22
- Glasshouse v0.1 发布:197 万 token 长对话记忆基准,2847 题不设总分 — True_Mongoose_7073 · 2026-09-22