IFM研究循环语言模型定点特性:KV缓存缩小3倍不掉分

IFM · hf · 2026-10-06

把循环语言模型做对(二):在不动点处重新思考

循环语言模型每多一轮循环,在训练、解码、预填充和 RL 上都要付出代价。本文核心洞察:循环状态越接近不动点,到达路径就越不重要。由此带来四项优化:

作者进而改进塑造不动点的两个组件:

结果:从 100M 到 1.6B,学习先验与正交注入在各规模上都降低困惑度;1.6B 下用 3 倍小的 KV 缓存即可匹配全缓存的固定深度训练的下游平均分。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →