llama.cpp 推理预算控制实测:Token 消耗减半且精度不降
hellajacked · reddit · 2026-07-30
开发者分享了 llama-mindcontrol(针对 llama.cpp 的引导式推理预算控制工具)的最新基准测试结果。该工具通过在采样层面引入自我感知声明来引导模型的思考预算,而非简单粗暴地直接截断输出。
在 Qwen3.6-27B 上的测试表明:
- Token 消耗显著下降:在 LiveCodeBench 测试中,完整引导机制(intro+soft+hard)在各项预算设置下均优于原生截断,最高效配置使用的 Token 量不到原生方式的一半,且保持了同等得分。
- 准确率未受拖累:在 HumanEval+ 上,多数配置直接追平甚至超越了无约束的基线表现。得分最高的配置(95.7%)恰恰来自引导最严格、预算最受限的设置。
作者推测,限制预算能防止模型在简单问题上过度思考或陷入退化循环。虽然在最难的问题子集上准确率依然受限,但这证明了复杂任务本身就需要更多思考。整体而言,该技术在不牺牲整体准确性的前提下大幅降低了推理成本。
「编程与Agent」频道最新
- ClaudeSkills:13个端到端自动化技能,让Claude Code直接交付成品 — tom_doerr · 2026-07-30
- 把工作目录变成“我”:开发者分享无头 Agent 架构与记忆设计 — PlentyWrongdoer3034 · 2026-07-30
- 四种RAG架构解析:从基础检索到智能体驱动的演进 — PawelHuryn · 2026-07-30
- AI Hero 推出面向工程师的免费 AI 技能课程 — mattpocockuk · 2026-07-30
- Matt Pocock 发布 Wayfinder:用 AI 规划复杂项目并同步任务看板 — mattpocockuk · 2026-07-30
- 用 Claude Code 打造全自动 SEO 管家,已开源 — Caitaline_Evars · 2026-07-30