单次前向输出决策结果:用 Qwen3-1.7B 复刻 Jev 决策模型

bibryam · x · 2026-10-11

Nish Tahir 撰文讲解「System one」决策模型的原理与自制方法。语言模型即使配合 Structured Output 输出合法 JSON,也要为每个 token 做一次前向传播,示例中生成最终输出需 11 次前向;而 Jev 这类决策模型假设答案是固定选项集(如 A–E),通过词表掩码把输出约束到这些 token,单次前向即可选出概率最高的答案,速度大幅提升。作者用 Qwen/Qwen3-1.7B + transformers 手写代码复刻了这一行为,并提醒两点:约束输出不保证正确;直接把 token 概率当置信分数也不严谨——未做额外训练时它反映的是「下一个 token 的置信度」而非答案正确的真实概率。文章附可视化演示与完整代码。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →