GPU竞赛:紧凑Householder QR内核实现232倍加速
petrusenko_max · x · 2026-08-15
在GPU Mode的竞赛中,一个批处理紧凑Householder QR内核实现了相对于基线的232倍加速,在183个参赛作品中排名第12。14天内,1500多个提交通过跨矩阵大小的运行时反馈实现了迭代改进。
「Infra」频道最新
- llama.cpp 集成 Moonshot Kimi-K3 文本模型 — pmttyji · 2026-08-15
- 自托管 Qwen3.8-27B 实测:推理跑出 200+ tokens/秒 — gnukeith · 2026-08-15
- AMD内部硅光子团队与Ayar Labs合作,进展或超联发科 — zephyr_z9 · 2026-08-15
- Light Trace Photonics推出可拆卸光子互连,瞄准AI数据中心 — BenBajarin · 2026-08-15
- vLLM 在 AMD v620 显卡上运行 Qwen 的配置求助 — Thin_Pollution8843 · 2026-08-15
- AI 网络防御窗口期仅剩约两年 — chrisrohlf · 2026-08-15