Armin Ronacher:多数模型的推理档位写在系统提示里,切换即废 KV 缓存
mitsuhiko · x · 2026-09-06
Armin Ronacher(mitsuhiko)在回复中点破一个非显然机制:多数模型的 reasoning effort 档位其实写在系统提示中,因此会话中途切换档位会使 KV 缓存全部失效,代价高昂;主要例外是 Fable 5.1,它允许在对话中途切换推理档位。其链接的博客文章《What Is Reasoning》进一步解释:
- 推理轨迹本质就是普通文本,模型被训练先在 scratchpad 中思考再给最终答案,GPT-OSS 的 Harmony 格式(analysis/final channel)可以清晰看到这一点;闭源模型则推测由简单模型做遮蔽和摘要。
- 早期 API 暴露的 reasoning token 预算让人以为是采样层属性,实际上 reasoning effort 是烘焙进系统提示的。
- 背景:一篇展示如何从闭源模型提取推理轨迹的论文引发讨论,促使他研究这一机制。
所属事件:切换推理档位会刷新 KV 缓存成开发者新坑(3 条相关)→
「编程与Agent」频道最新
- ETH Zurich 测试百名开发者:文字表达力是 vibe coding 关键预测指标 — _akpiper · 2026-09-06
- 图像+视频+智能体协同,新工具推进 Agentic 视频创作 — Lianhuiq · 2026-09-06
- ghost agent 全天候监控电脑,发现项目问题后请求授权自动修复 — BLUECOW009 · 2026-09-06
- 2000 人营销公司也只买 200 美元/月编码订阅,前沿模型太贵 — Crafty-Sugar2507 · 2026-09-06
- AI 写码时代,这 8 本软件经典反而更重要了 — bibryam · 2026-09-06
- 实测 8 个远程 MCP 服务器:最大者握手就吃掉 3.3 万 token — FreeMembership5107 · 2026-09-06