AMD 发布 TokenSpeed-Kernel:以 Triton 基线为语义契约,打通多芯片 LLM 推理
zhyncs42 · x · 2026-10-02
AMD 在 PyTorch 官方博客发布开源子系统 TokenSpeed-kernel,解决多芯片 LLM 推理的后端复杂度问题:
- 分层 API 设计:kernel-runtime 接口保持通用与平台无关,运行时拥有模型执行、调度元数据、页表和路由状态;kernel 层拥有算子 API、后端注册与高性能实现。
- Triton 作为语义契约:每个 kernel 必须有一个可移植的 Triton 基线实现。这不仅是可移植性保障,更日益成为「语义契约」——一个精确定义张量语义的数值参考实现,让更激进的专用 kernel 有据可依,agent 可在此基础上探索 Gluon 等更低层的调度与内存布局控制。理念是「语言即契约、编译器即验证器」。
- 实测结果:以 GPT-OSS 为例,运行时在 AMD 与 NVIDIA 路径上调用同一套公共 API;AMD 上的 GPT-OSS 120B 借助 Gluon kernel 达到顶级性能,证明分层设计不以牺牲后端性能为代价。
「Infra」频道最新
- 东芝斥资 600 亿日元扩产菲律宾工厂,AI 用 HDD 产能将翻倍 — zephyr_z9 · 2026-10-02
- USC 提出 HeteroFold:跨模型家族 KV 缓存免预填充传输,32K 上下文快 10.7 倍 — UniversityofSouthernCalifornia · 2026-10-02
- 扎克伯格:多吉瓦级训练集群暴力堆算力即可逼近 AGI — rohanpaul_ai · 2026-10-02
- 1.3微秒CPU检测幻觉:120B大模型反而集体自信胡编 — More_Slide5739 · 2026-10-02
- 开源 CodexBar 上架菜单栏:22k 星,一屏看尽各家 AI 额度 — lxfater · 2026-10-02
- HBM 仍是 AI 时代主导内存,至少到 2028 年位增长不见顶 — AccBalanced · 2026-10-02