实测发现编程时应禁用 MTP:长上下文下速度骤降

fbms2 · reddit · 2026-08-22

用户实测发现,多 Token 预测(MTP)在编程场景下弊大于利。虽然聊天模式下开启 MTP 在 5090 显卡上可达 140t/s,但在编程时,随着上下文超过 60k,速度会从 100t/s 骤降至 10-20t/s;禁用 MTP 后,速度虽起跑较慢(50t/s),但在高上下文下能稳定在 40t/s 左右。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →