MachGen 开源 Blackwell 版 VC Attention:比 BF16 FlashAttention 快约 2 倍
MiniMax_AI · x · 2026-10-08
推理公司 MachGenAI 宣布开源其面向 NVIDIA Blackwell 的 VC Attention 变体:在 B200 上达到 BF16 FlashAttention 约 2 倍速度,用于 MiniMax H3 等模型。团队在原论文基础上做了多项改进,性能再提升 20% 以上,现已达到其生产环境稠密注意力核的约 30% 以内,且所需校准大幅减少、无需微调。
作者强调推理优化 = kernel + recipe:强 kernel 把硬件推向极限,好 recipe 把速度变成真实系统;强 kernel 开源后,原本一家公司的护城河可以变成所有人的地基。适合关注 Blackwell 推理优化的工程团队。
「Infra」频道最新
- 光收发芯片为何输出波导要倾斜?作者再追问端面角度设计的门道 — jwt0625 · 2026-10-08
- 中国电力过剩反成数据中心红利,算力供应链现「用电反差」 — teortaxesTex · 2026-10-08
- NAVER 提出 DLoop:投机解码连续起草多轮再验证,加速提升 5-41% — naver-ai · 2026-10-08
- 变压器交货从500天飙至1120天,YC 合伙人称之为创业新机会 — ycombinator · 2026-10-08
- MIT 研究员用 AI 给数据中心节能,降低宕机与能耗 — nordicinst · 2026-10-08
- FT 三部曲首篇:实探乌兰察布到韶关的中国 AI 算力大基建 — zijing_wu · 2026-10-08