字节跳动提出 Modular TTT:将测试时训练模块化并系统消融
ByteDance-Seed · hf · 2026-08-10
测试时训练(TTT)将序列建模视为在线学习问题,但现有方法通常各自硬编码,难以隔离各组件的作用。字节跳动提出了 Modular TTT 框架,将内部学习器表示为有向无环图(DAG)。
- 模块化设计:将快权重网络、损失函数、学习率、权重衰减和归一化作为显式的设计维度,自动组合成完整的 TTT 计算。
- 消融发现:小学习率初始化、权重衰减和单层非线性能提升性能;MSE 和内积损失表现相似。而更深的快权重网络和归一化会因产生过大的激活值而损害性能。
- 模型表现:基于这些发现,研究者在 1000 亿 token 上训练了 4.1 亿 和 14.5 亿 参数的模型,其训练损失和基准性能可与 Gated DeltaNet 媲美。
「研究」频道最新
- 单个智能体搞定一切:ReASearch 统一提示词与 ML 工作流优化 — _reachsumit · 2026-08-10
- Sakana AI 总结「AI Scientist」进展:端到端科研自动化 — SakanaAILabs · 2026-08-10
- NBER 论文探讨 AI 智能体经济学:交易成本骤降重塑市场设计 — danielrock · 2026-08-10
- Meta 推出 SYF:基于 LLM 的实时交互式推荐智能体 — _reachsumit · 2026-08-10
- Naver Webtoon 提出推荐模型三阶段对齐框架 — _reachsumit · 2026-08-10
- 音乐推荐新基准:六大音频嵌入模型实证对比 — _reachsumit · 2026-08-10