Wafer 发布 AI 性能工程仓库:CUDA、FlashAttention 到量化全覆盖
Hesamation · x · 2026-09-21
Wafer 发布了一个号称全球最全的 AI 性能工程(AI performance engineering)资源仓库,内容涵盖:
- GPU 基础与 CUDA 编程
- kernel 优化
- FlashAttention
- KV caching 与量化
- NVIDIA、AMD 及 TPU 架构
所有条目都链接到可靠的官方文档、论文和仓库,并作为系列内容持续更新,首篇为 NVIDIA CUDA Programming Guide 的 CUDA C++ 入门(kernel 启动、线程组织、内存管理等)。适合想深入推理优化与底层硬件性能调优的工程师收藏。
「Infra」频道最新
- 16 节点 GB10 集群跑满 2.8T 参数 Kimi K3:编码解码 30 tok/s — ciprianveg · 2026-09-21
- KDA/Mamba 长缓存复用踩坑:恢复长 prompt 触发非法内存访问 — TheZachMueller · 2026-09-21
- 量化模型上下文 128k 配压缩优于裸跑 256k/1M — Informal-Trouble2183 · 2026-09-21
- BNEF:2035 年美国数据中心天然气消耗将超德日总和 — Beth_Kindig · 2026-09-21
- RLinf 集成 SGLang 跑 Cosmos3,端到端评估吞吐提升 3.33 倍 — ying11231 · 2026-09-21
- 用超快小模型 Jev 预筛任务,为 Claude/Codex 省下大量 token — draginol · 2026-09-21