Kimi K3 架构解析:用「主动遗忘」打造 2.8 万亿参数开源模型
AccBalanced · x · 2026-07-31
一篇关于 Kimi K3 模型的详细技术解析。K3 是目前最大的开源模型,总参数量达 2.8 万亿,但单次推理仅激活 1040 亿参数。
- 核心创新:为解决长上下文导致内存堆积变慢的问题,K3 引入了 Kimi Delta Attention 机制。
- 主动遗忘:每四层网络中有三层使用固定大小的显存工作区,通过覆盖过时信息来阻止内存无限增长;第四层则保留压缩记录以确保细节可追溯。
- 验证过程:团队先在 480 亿参数的小模型上验证了该机制能大幅降低内存消耗,随后才扩展到万亿级别。
所属事件:Kimi K3 架构解析:2.8万亿参数与主动遗忘机制(2 条相关)→
「模型」频道最新
- 传 Gemini V4 将砸数十万亿 Token,多模态能力迎大升级 — teortaxesTex · 2026-07-31
- DeepSeek V4-Flash 硬核破解俄语笑话,智力密度惊人 — teortaxesTex · 2026-07-31
- 模型选择即组织设计:用企业架构视角规划 AI 工作流 — every · 2026-07-31
- DeepSeek-V4-Flash 跑分曝光:智商密度提升,定价引争议 — teortaxesTex · 2026-07-31
- 实测 Inkling Small 模型:带视觉能力,能独立开发 Flappy Bird — LiTianleli · 2026-07-31
- DeepSeek-V4-Flash 正式版 API 上线,Agent 能力跃升且价格击穿底线 — 智东西 · 2026-07-31