把问题放到 prompt 开头,本地 Qwen 准确率 89%→100%,延迟降 5 倍
Micha0827 · reddit · 2026-09-21
作者用本地 Qwen 模型做「类型化决策」:给定状态和一个答案受限的问题,直接读一次前向传播的 logits 概率而非生成文本。他发现把 prompt 从「先情境后问题」改为「先问题和候选答案、状态放最后」,效果同时提升:在 38 个短情境的基准上,M2 Max 上跑 4-bit Qwen3.6-35B-A3B,英语准确率 89%→100%,德语 89%→97%,中位延迟约 400ms→80ms。
- 速度提升原因:问题块成为所有调用相同的前缀,可被 KV cache 复用,只算一次。
- 准确率提升原因:作者推测模型在已知「要找什么」时对状态的解读方式不同。
- 注意事项:长文档场景下「问题先行」仍提升准确率,但会慢 6–8 倍,因为文档无法跨问题缓存。
代码与基准已开源:github.com/Micha0827/snapjudge,作者想验证该效应是否同样适用于 JSON 抽取、工具路由等常规生成任务。
「编程与Agent」频道最新
- Anthropic 工程师 22 分钟搭出 Claude Code 异步自主工作流 — anthara_ai · 2026-09-21
- 砍掉读写编辑工具、只留 bash 给编码模型跑分会怎样? — lucasmeijer · 2026-09-21
- 8 种数据测试模式:让数据管道在进报表前先过八道关 — goyalshaliniuk · 2026-09-21
- Turnfeed 开源 MCP 示例:让模型读懂嵌套回复的归属关系 — SomePush6146 · 2026-09-21
- Google Cloud 预览 Gemini 强化微调:自定义奖励函数调优 — rseroter · 2026-09-21
- M5 Ultra Mac Studio 实测:被称跑本地 AI Agent 的梦想 Mac — themixtergames · 2026-09-21