Kimi K3 据称沿用 block attention residuals,模型共 93 层
burny_tech · x · 2026-07-28
一条转发在讲 Kimi K3 的 attention residuals 设计和训练/基础设施细节。
- Kimi K3 维持了 block attention residuals 的原设计。
- 据转述,模型采用 8 个 block、每个 12 层 的结构,外加一个不完整的最后 block;如果把 embedding layer 也算上,可视作 9 个 block。
- 帖子还给出它有 93 层、hidden size 7168。
- 观点是:aspect ratio 77 很保守,体现出模型更偏向“更深而不是更宽”,而 attention residuals 在深层模型里效果更好。
「Infra」频道最新
- Kimi K3 在 AMD MI350X 上跑通,四路并发达 327 tok/s — burny_tech · 2026-07-28
- llama.cpp 基准显示 ROCm 与 Vulkan 在 AMD R9700 上互有胜负 — Gesha24 · 2026-07-28
- NASA 新任管理员称 SpaceX 押注轨道数据中心将成真 — elonmusk · 2026-07-28
- Reddit 讨论解锁后的 CMP 170HX 能否支撑本地 AI 机架 — Tritheone69 · 2026-07-28
- 开源权重模型被视为大公司的安全部署方案 — jessi_cata · 2026-07-28
- Dolphin 基于 72 张 4090 训练 Trinity Large Thinking 398B — QuixiAI · 2026-07-28