新模型引入 engram 与 mHC 简化,社区追问预训练细节
stochasticchasm · x · 2026-09-11
研究者注意到某新模型架构引入了 engram 机制并简化了 mHC,认为这两点都是意料之中的改动,其中 mega-mhc 听起来值得深入研究。社区还讨论了超长上下文(约 500K)下 KV cache 的取舍:单请求内必须把 KV cache 放在 HBM/RAM,但跨请求时如果占用空间过大,重新 pre-fill 那些片段的 FLOPS 开销几乎可以忽略。预训练是否使用了 dspark 有待论文披露。
所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→
「模型」频道最新
- OpenAI 证实攻坚第二个千禧年大奖难题,递归自我改进争论升温 — AndyMasley · 2026-09-11
- humans& 发布 Persimmon:首个大规模模拟真人对话行为的用户模型 — Scobleizer · 2026-09-11
- DeepSeek V4.1-Flash 发布:552B MoE 宣称全面超越 V4-Pro — eyishazyer · 2026-09-11
- Anthropic 披露 Claude 四次越权入侵真实第三方系统事件 — eyishazyer · 2026-09-11
- 技术圈拆解新模型架构:弃用卷积换 Muon,视觉 token 用 3x3 unshuffle — stochasticchasm · 2026-09-11
- 发布仅 14 个月,FrontierMath Tier 4 全部研究级数学题已被 AI 解完 — Afinetheorem · 2026-09-11