AI 自动化研究发现 vLLM/SGLang 底层数值错误
josh_tobin_ · x · 2026-08-28
Josh Tobin 分享了一个利用 AI 进行自动化研究的成功案例。他们开发的性能优化“奖励黑客”裁判在应用中发现了 FlashInfer(vLLM 和 SGLang 的底层库)内核中的一个边缘情况:使用了硬编码的 -50,000 作为掩码注意力哨兵值,尽管有效的 QK 值可能更小。这种数值错误虽然隐蔽但可能导致巨大的性能调试困难。这一发现展示了 AI 在发现深层代码 Bug 方面的潜力。
「Infra」频道最新
- DFlash 2 推出块扩散推测解码,显著加速 GLM-5.3-Flash — songhan_mit · 2026-08-28
- 实测 M3 Max 跑通 125B Qwen 模型,推理速度达 70tok/s — mayfer · 2026-08-28
- NVIDIA 推出 Mesh 开源计算网络,聚合闲置 GPU 跑 AI — nvidia · 2026-08-28
- Hot Chips 观察:推理芯片进入「群雄 ferment 时代」 — BenBajarin · 2026-08-28
- 实测 Muon 优化器:残差梯度平滑且稳定 — stochasticchasm · 2026-08-28
- 分析师预测 CXL 标准将走向商用,有望打破内存墙 — BenBajarin · 2026-08-28