把问题放到 prompt 开头,本地 Qwen 准确率 89%→100%,延迟降 5 倍

Micha0827 · reddit · 2026-09-21

作者用本地 Qwen 模型做「类型化决策」:给定状态和一个答案受限的问题,直接读一次前向传播的 logits 概率而非生成文本。他发现把 prompt 从「先情境后问题」改为「先问题和候选答案、状态放最后」,效果同时提升:在 38 个短情境的基准上,M2 Max 上跑 4-bit Qwen3.6-35B-A3B,英语准确率 89%→100%,德语 89%→97%,中位延迟约 400ms→80ms。

代码与基准已开源:github.com/Micha0827/snapjudge,作者想验证该效应是否同样适用于 JSON 抽取、工具路由等常规生成任务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →