博主解读稀疏注意力训练信号:无需稠密热身或预示训练范式转变
stochasticchasm · x · 2026-09-11
博主 stochasticchasm 讨论稀疏注意力训练进展:当稀疏注意力版本不再需要稠密注意力热身阶段,是好信号。长上下文预训练很可能由更低的 prefill FLOPs 所支撑,而且更早引入类 agent 轨迹数据在训练中也可行——意味着 midtraining 阶段正在被吸收。前文提到 engram 模块进入模型、mHC 的简化(mega-mHC),并猜测是否在预训练中使用了 dspark,答案有待论文揭晓。
所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→
「研究」频道最新
- Michael Levin「柏拉图空间」论文过审:心灵非物理主义引巨大争议 — ZeroStateReflex · 2026-09-11
- 单张 RTX 3090 训 8 天:GPT-2 改造 MoE 从零训练成功 — rasbt · 2026-09-11
- 数学家如何回应 Navier-Stokes 证明引热议 — silver__tsuki · 2026-09-11
- 社交类多 LLM 环境太复杂,模型或学启发式而非建模评分器 — 1a3orn · 2026-09-11
- 「别扔掉奇怪的结果」:Lila Sciences 开放式发现团队的研究哲学 — tw_killian · 2026-09-11
- blocker 实验让果蝇「变弯」:16 万神经元模型上的真实操作 — dejavucoder · 2026-09-11