PyTorch + KV 缓存加速 HSTU 推荐模型,延迟最高降 5.93 倍
PyTorch · x · 2026-10-09
生成式推荐系统把个性化重新表述为对用户行为序列的建模。NVIDIA recsys-examples 提供了基于 Dynamo-Triton 的端到端 HSTU 推理工作流:
- PyTorch AOTI 将 HSTU 排序模型编译为原生 C++ 产物
- FlexKV 支持的 KV 缓存复用注意力状态,避免重算长用户历史
- 在 RTX PRO 6000 Blackwell 工作站 GPU 上,8 层 HSTU 模型在 batch size 8、KV 缓存命中率 100% 时,延迟较无缓存配置降低最高 5.93 倍
「Infra」频道最新
- Chollet:AI 投入呈超指数增长,产出却仅亚线性回报 — fchollet · 2026-10-09
- FineWeb 作者:用 27B 模型标注预训练数据很疯狂,但通用模型更省部署 — antoine_chaffin · 2026-10-09
- 魔改 MLX 把量化权重暂存到 FP8,M6 prefill 提速 40% — Brilliant-Hall1387 · 2026-10-09
- a16z:Agent 消耗 token 是人类 5 倍,半年增长 14 倍,AWS 为机器用户重构 — a16z · 2026-10-09
- 微软 Surface RTX 开发机砍掉 ConnectX-7 网卡,难以组集群 — Scobleizer · 2026-10-09
- PyTorch 原生支持 AWS Trainium,PyTorch 大会将现场演示 — PyTorch · 2026-10-09