博主解读稀疏注意力训练信号:无需稠密热身或预示训练范式转变

stochasticchasm · x · 2026-09-11

博主 stochasticchasm 讨论稀疏注意力训练进展:当稀疏注意力版本不再需要稠密注意力热身阶段,是好信号。长上下文预训练很可能由更低的 prefill FLOPs 所支撑,而且更早引入类 agent 轨迹数据在训练中也可行——意味着 midtraining 阶段正在被吸收。前文提到 engram 模块进入模型、mHC 的简化(mega-mHC),并猜测是否在预训练中使用了 dspark,答案有待论文揭晓。

所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →