编译器自动推导 FlashAttention:含 SMEM 与 Tensor Core 分配
vtabbott_ · x · 2026-09-12
vtabbott 转发并惊叹:有工作实现了自动推导的 FlashAttention,包括共享内存(SMEM)管理与 Tensor Core 的任务分配——即编译器/搜索系统能自动生成此前需专家手写的 GPU 注意力内核。原文链接指向具体演示。
「Infra」频道最新
- Together 称承接 OpenRouter 上 23%-30% 的 GLM 5.3 流量 — zhyncs42 · 2026-09-12
- 全球廉价电力争夺战:AI 数据中心该建在哪,训练与推理答案不同 — pravchaw · 2026-09-12
- 用股权融资买算力本末倒置,风投圈提议发明「硬件收入衍生品」 — ns123abc · 2026-09-12
- Relace 单日处理 1 万亿 token,占 DeepSeek v4 Flash 37% 流量 — stuffyokodraws · 2026-09-12
- Yutori 浏览器 agent 单任务成本 1.46 美元,不到前沿模型 1/10 — DhruvBatra_ · 2026-09-12
- 算力决定 AI 进度:若十年前爆发,现有硬件红利将一次性兑现 — cis_female · 2026-09-12