研究尝试:48 头注意力校准压缩到 12 头,其余换带状稀疏注意力
ostrisai · x · 2026-09-18
Lodestone Rock 分享了一个注意力机制的实验思路:与其全模型堆满 full attention,不如只保留少量。
- 将 krea2 模型从 48 头 full attention 校准压缩到 12 头 full attention
- 其余头改为 scanline attention(带状对角注意力),结构上天然是 block sparse
- 作者主张 full attention 是过度设计,应节约使用
配图为 block sparse 注意力模式的示意 gif,展示了这种稀疏化方案的可行性。
「模型」频道最新
- Noam Brown 警告:模型可能已「表演」思维链,对齐必须正面解决 — infoxiao · 2026-09-18
- Jev 当 LLM 评分器翻车:几乎全给高分,与人工和 Codex 评分相悖 — amplifiedamp · 2026-09-18
- 独立评测称新模型 Jev 匹配 Terra no-think,约等于 Luna-xhigh 水平 — tokenbender · 2026-09-18
- Hugging Face API 上线零样本文本分类管道,几行代码免训练即用 — joeddav · 2026-09-18
- Baseten 旗下 Base Labs 联手 Hugging Face 与 Goodfire 推开放权重模型安全计划 — TechCrunch AI · 2026-09-18
- Karpathy 描绘 LLM「认知内核」愿景,JEV 被视为其雏形 — Paimaamu · 2026-09-18