研究揭示 TTT 本质是线性注意力,提速 4 倍
jm_alexia · x · 2026-08-28
研究人员发现,被寄予厚望的 TTT(Test-Time Training)模型在数学本质上并非真正的「记忆」,其梯度更新实际上等价于线性注意力。剥离这一虚幻机制后,推理速度提升了 4 倍,同时并未损失上下文深度。
「研究」频道最新
- Schmidhuber 考古 1988 年首个反向传播 CNN — SchmidhuberAI · 2026-08-28
- 用 700 行 C 语言实现 Gemma 4 运行时 — Critical_Physics8 · 2026-08-28
- LoRA+GRPO 微调 8B 模型仿写名家博文,骗过全部商用 AI 检测器 — OtherRaisin3426 · 2026-08-28
- 田野调查数据杂乱,AI 处理非结构化痛点显现 — anthara_ai · 2026-08-28
- 评测防作弊新思路:给模型发评测者改版前的旧缓存 — willcb · 2026-08-28
- 研究 40 万次 Claude 会话:懂业务的比懂代码的用得更好 — alex_verem · 2026-08-28