技术推主分析稀疏注意力长上下文训练:无需稠密预热是好信号

stochasticchasm · x · 2026-09-11

stochasticchasm 对某前沿模型训练配方的技术分析:- 稀疏注意力版本不再需要稠密注意力 warmup,是好的信号;低 prefill 算力使长上下文预训练成为可能。- 团队已有成熟配方、batch invariant kernel、低精度推理等支撑稳定 RL,此阶段最值得关注的是数据。- 这种训练方式可能让 agentic traces 更早进入训练过程,“midtraining 正在被吸收”。- 作者预测目前尚无人批评,但对方迟早会引入某种 value modeling。

所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →