79K 参数小模型实测 RLT:能学状态追踪但长序列泛化差
mike64_t · x · 2026-09-14
有人对近期受关注的 RLT(循环推理模型)做了一次小规模复现:79K 参数、3 个随机种子,在 32 步训练下跑两个合成任务,测最终状态准确率。
- 32 步任务:两个种子均达 100%
- 128 步任务:准确率掉到 60.8% 和 20.7%
- 同条件下的 GRU 在两个长度都接近 100%
结论是 RLT 确实能学会状态追踪,但泛化到更长序列时明显吃力。回复者提出了更深一层的分析:传统循环单元在合成状态追踪任务上有「不合常理地好」的归纳偏置——它们可以直接表达所需计算,并因 teacher forcing 轻松学到精确形式,而 Transformer 被迫构造近似。他认为把这类合成任务类比到推理式计算并不恰当,用预训练损失增益来评测循环模型的推理能力可能是错误的基准角度;推理本质上是重召回任务,需要访问不同参数,这正是「深度共享」与「参数独立」建模语言的本质差异。
「模型」频道最新
- 博主吐槽 Claude 评测很好用起来诡异,疑后训练引入怪癖 — MaziyarPanahi · 2026-09-14
- 开发者吐槽 Claude Opus 5 本周又变笨了 — draginol · 2026-09-14
- 智谱融资 50 亿美元,六成投向下一代 GLM 与"自训练"递归循环 — teortaxesTex · 2026-09-14
- 用户吐槽 Opus 写作:「编造术语」像轻度煤气灯 — julianharris · 2026-09-14
- Ollama 联合创始人:小模型已能胜任大多数对话与推理场景 — ollama · 2026-09-14
- 用户吐槽 GLM Flash 5.3 输出频繁滑回中文 — DevDminGod · 2026-09-14