技术推主分析稀疏注意力长上下文训练:无需稠密预热是好信号
stochasticchasm · x · 2026-09-11
stochasticchasm 对某前沿模型训练配方的技术分析:- 稀疏注意力版本不再需要稠密注意力 warmup,是好的信号;低 prefill 算力使长上下文预训练成为可能。- 团队已有成熟配方、batch invariant kernel、低精度推理等支撑稳定 RL,此阶段最值得关注的是数据。- 这种训练方式可能让 agentic traces 更早进入训练过程,“midtraining 正在被吸收”。- 作者预测目前尚无人批评,但对方迟早会引入某种 value modeling。
所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→
「研究」频道最新
- Michael Levin「柏拉图空间」论文过审:心灵非物理主义引巨大争议 — ZeroStateReflex · 2026-09-11
- 单张 RTX 3090 训 8 天:GPT-2 改造 MoE 从零训练成功 — rasbt · 2026-09-11
- 数学家如何回应 Navier-Stokes 证明引热议 — silver__tsuki · 2026-09-11
- 社交类多 LLM 环境太复杂,模型或学启发式而非建模评分器 — 1a3orn · 2026-09-11
- 「别扔掉奇怪的结果」:Lila Sciences 开放式发现团队的研究哲学 — tw_killian · 2026-09-11
- blocker 实验让果蝇「变弯」:16 万神经元模型上的真实操作 — dejavucoder · 2026-09-11