RTX 5090 推理飙升至 233 tok/s,推测解码效果远胜 Mac

rohanpaul_ai · x · 2026-08-10

作者对比了推测解码在不同消费级硬件上的收益,发现其在桌面 GPU 上的表现远优于 Mac。具体数据显示,RTX 5090 的推理速度从 74.9 tokens/s 跃升至 233 tokens/s,而 M4-Max 仅从 23.7 提升到 38 tokens/s。

推测解码的核心机制是让一个小型快速模型猜测一个 token 块,再由大模型一次性验证。文中特别提到了 Meta 随 Muse Glimmer 模型一同发布的 DFlash 轻量级推测模型,它通过提议整个 token 块并由主模型并行验证,从而大幅提升整体推理效率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →