Armin Ronacher 长文解析:reasoning effort 如何写进系统提示词并破坏 KV 缓存
mitsuhiko · x · 2026-08-20
Flask 作者 Armin Ronacher 发表长文《What Is Reasoning》,从一篇能从闭源模型提取推理轨迹的论文出发,澄清了 Twitter 上关于 CoT 泄漏的诸多误解:
- 推理轨迹并不神秘:它本质就是普通文本,模型被训练成在回答前的"草稿区"(scratchpad)输出思考过程。以 GPT-OSS 的 Harmony 格式为例,analysis 通道与 final 通道使用同一种文本,只是由特殊 token 分隔,解析器据此把推理文本路由到单独的 API 流;闭源模型则可能由另一个模型做脱敏与摘要。
- reasoning effort 其实写在系统提示词里:早期 API 暴露的"推理 token 预算"让它看起来像采样参数,实际上推理力度是烤进 system prompt 的。
- 文章还解释了为何修改 reasoning effort 会使 KV 缓存失效,以及 CoT 轨迹为何会泄漏——对于做推理服务优化的工程师很有参考价值。
「模型」频道最新
- llama.cpp 集成 dflash2:Qwen 3.8 27B 推理提速至 3 倍 — Top-Eye-8104 · 2026-08-20
- 开发者实测:Qwen 3.8 27B 仅低推理档可用 — andrejusb · 2026-08-20
- Grok 免费层已开放,但额度结构多变且不固定 — heypearlai · 2026-08-20
- 冷门技巧:通过 LMArena 免费无限使用 400+ 模型 — heypearlai · 2026-08-20
- ChatGPT 免费版已无限制,Claude 免费版用上 Sonnet 5 — heypearlai · 2026-08-20
- Qwen 3.8 27B 跑出 70t/s:参数配置全公开 — dsdt · 2026-08-20