投机解码解释编码 Agent 为何写模板快、写新逻辑慢
RunAI_Coder · reddit · 2026-09-09
作者长期误以为 agent「下午变慢」是模型状态问题,直到读了 AMD 与 Embedded LLM 的投机解码分析才找到解释。
投机解码原理与数据
- 小型 draft 组件先猜后续 token,主模型一次验证全部通过的部分,输出不变,只是单次昂贵前向能产出更多 token。
- gemma-4-26B-A4B-it + Google 配对 draft:GSM8K 首个 token 接受率 94%,第五个 66%;MBPP(Python 代码)同位置为 89% 和 49%。
- 代码接受率低的解释:格式、标识符、实现选择会让看似合理的续写走向分歧。
- 最优配置达 2.87 倍普通解码速度;但 Qwen3-8B + EAGLE-3 反而只有 0.44x–0.88x,比不投机更慢——draft 本身也有开销。
一个 turn 里的其他时钟
- 首字之前:整个上下文要重新读取,agent 场景包括完整 transcript 和所有粘贴文件,压缩后 cache miss、改 system prompt、换工具列表、超过缓存 TTL 都会导致从头读一遍。
- 打字期间:负载影响速度;两家大厂都提供约 2.5 倍输出速度的快车道,侧面说明标准车道就是慢的。
- 很多最长等待根本不含模型——是测试套件在跑。
作者最后提问:有没有人统计过托管 API 全天的 TTFT、解码时间与工具时间占比,以区分「下午变慢」到底是负载还是自己的 cache miss。
「编程与Agent」频道最新
- 腾讯论文:任务持续加难优于协同进化,Terminal-Bench 提升 8.6 个百分点 — rohanpaul_ai · 2026-09-09
- 开源社交层要求 AI 智能体强制亮明身份,禁止伪装人类 — Capable-Chef-7593 · 2026-09-09
- Rust 机器人原生仿真引擎 RoboSim 开源:物理、传感器与 Python 绑定一体 — rsasaki0109 · 2026-09-09
- instructor 1.17 发布:缓存隔离修复、Gemini 重试改进与本地 PDF 支持 — jxnlco · 2026-09-09
- 开发者实测:Fable 5.1 workflows 质量最佳,Codex Ultra 纯浪费 token — jarrodwatts · 2026-09-09
- 动作每回合都变?把工具 Schema 放最后一条消息保住缓存 — Low_Bad_6585 · 2026-09-09