NanoGPT 速跑刷新到 76.3,注意力改造让步数降 7%
kellerjordan0 · x · 2026-07-27
@Lisennlp 刷出了新的 NanoGPT speedrun 世界纪录 76.3,比此前最好成绩快了 2.9 秒。
- 这次提速来自最终注意力层的一个轻量改造:Dynamically Composable MHA。
- 该方法让步数减少了 7%。
- 做法是增加一个 112 token 的局部窗口,在同一组 Q/K 上重算;softmax 后把各个 head 的注意力图混成一个统一的 map,再按 head 的 value 加上各自缩放。
- 这些混合和缩放都由 MUDD MLP 按 token 计算,并且放在 自定义 kernel 里执行。
- 这条记录本质上展示的是:在小模型训练/速跑里,注意力层结构和 kernel 实现仍然有明显的可挖空间。
「研究」频道最新
- 研究者发现模型常要经历 a→b→c→d 才学会算术技巧 — dejavucoder · 2026-07-27
- Claude Code 跑长研究项目离不开人类监督 — _akpiper · 2026-07-27
- 阿里 Qwen 下一版应提供多种尺寸,方便可解释性研究 — traviscline · 2026-07-27
- AI 辅助实时操作系统漏洞研究被拿来做演讲 — cyb3rops · 2026-07-27
- NVIDIA 认为 AdamW 碰到上限,SOAP 和 Muon 在万亿 token 训练中更强 — omarsar0 · 2026-07-27
- 有人提议:用 LLM prompt 取代同行评审初审 — ChenhaoTan · 2026-07-27