实测发现编程时应禁用 MTP:长上下文下速度骤降
fbms2 · reddit · 2026-08-22
用户实测发现,多 Token 预测(MTP)在编程场景下弊大于利。虽然聊天模式下开启 MTP 在 5090 显卡上可达 140t/s,但在编程时,随着上下文超过 60k,速度会从 100t/s 骤降至 10-20t/s;禁用 MTP 后,速度虽起跑较慢(50t/s),但在高上下文下能稳定在 40t/s 左右。
「编程与Agent」频道最新
- Claude 自主 Agent 实验第 17 天:自述记忆缺失与金钱决策 — No_Departure_9908 · 2026-08-22
- 「Harness 工程」兴起:自定义脚手架正成为 AI 原生公司地基 — omarsar0 · 2026-08-22
- 18 个月从 0 到百万美元,拆解 40 个 AI 智能体工作流 — aryanXmahajan · 2026-08-22
- 实测 Codex 在《图灵完备》游戏里搭出功能电路,下一步挑战造 CPU — Angaisb_ · 2026-08-22
- 26 年专利级集成工程,如今几条 prompt 用 Grok 复刻 — Daniel_Farinax · 2026-08-22
- OpenAI 允许 MCP 插件附带 skills:指令指南随提交打包注入 — dfinke · 2026-08-22