Fable优化Qwen内核跑出1398 tok/s

teortaxesTex · x · 2026-07-06

开发者让 Fable 进一步压榨 AlpinDale 的 Qwen3-0.6B 超算核(megakernel),在 bf16 下跑到约 1398 tok/s,接近 5090 显卡水平。展示了 AI 模型(Claude 系)在 CUDA 内核推理优化上的实战编码能力。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →