IFM研究循环语言模型定点特性:KV缓存缩小3倍不掉分
IFM · hf · 2026-10-06
把循环语言模型做对(二):在不动点处重新思考
循环语言模型每多一轮循环,在训练、解码、预填充和 RL 上都要付出代价。本文核心洞察:循环状态越接近不动点,到达路径就越不重要。由此带来四项优化:
- 训练:截断反向传播;
- 解码:终态 KV 共享,精度几乎无损;
- 预填充:蒸馏学生模型最高提速 1.79 倍;
- RL:从保存的 rollout 状态计算梯度,比沿轨迹回传快 2 倍。
作者进而改进塑造不动点的两个组件:
- 深度先验:固定深度训练会破坏 KV 共享,Huginn 的宽先验又稀释监督信号;改为从预测反馈学习先验,加熵项保持宽度;
- 输入注入:现有方案允许状态沿输入方向的分量放大或抵消注入,改用正交注入去掉该分量。
结果:从 100M 到 1.6B,学习先验与正交注入在各规模上都降低困惑度;1.6B 下用 3 倍小的 KV 缓存即可匹配全缓存的固定深度训练的下游平均分。
「模型」频道最新
- Daniel Han 盘点当前值得信赖的 LLM 基准 — danielhanchen · 2026-10-06
- UPenn NLP 论文:声明验证基准主要测检索,推理能力被高估 — deliprao · 2026-10-06
- UPenn 论文:LLM 验证科学论断靠捷径,非显著约束错误全部漏过 — deliprao · 2026-10-06
- 同等智能下该看单任务成本:Opus 多花 94% token 反而便宜 23% — ChrisGPT · 2026-10-06
- 发文者称 GPT-6 Astra 首个达到世界级天体物理水平的 AI — johnseach · 2026-10-06
- $500 订阅在雅加达是巨款,区域 PPP 定价引热议 — sujingshen · 2026-10-06