新模型引入 engram 与 mHC 简化,社区追问预训练细节

stochasticchasm · x · 2026-09-11

研究者注意到某新模型架构引入了 engram 机制并简化了 mHC,认为这两点都是意料之中的改动,其中 mega-mhc 听起来值得深入研究。社区还讨论了超长上下文(约 500K)下 KV cache 的取舍:单请求内必须把 KV cache 放在 HBM/RAM,但跨请求时如果占用空间过大,重新 pre-fill 那些片段的 FLOPS 开销几乎可以忽略。预训练是否使用了 dspark 有待论文披露。

所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →