单次前向输出决策结果:用 Qwen3-1.7B 复刻 Jev 决策模型
bibryam · x · 2026-10-11
Nish Tahir 撰文讲解「System one」决策模型的原理与自制方法。语言模型即使配合 Structured Output 输出合法 JSON,也要为每个 token 做一次前向传播,示例中生成最终输出需 11 次前向;而 Jev 这类决策模型假设答案是固定选项集(如 A–E),通过词表掩码把输出约束到这些 token,单次前向即可选出概率最高的答案,速度大幅提升。作者用 Qwen/Qwen3-1.7B + transformers 手写代码复刻了这一行为,并提醒两点:约束输出不保证正确;直接把 token 概率当置信分数也不严谨——未做额外训练时它反映的是「下一个 token 的置信度」而非答案正确的真实概率。文章附可视化演示与完整代码。
「研究」频道最新
- 实验室自动化困局:长尾实验跑不动,扼杀创新 — anshulkundaje · 2026-10-11
- 研究警示:engram/n-gram 方法在数据重复下或显著加剧过拟合 — SonglinYang4 · 2026-10-11
- MIT 发布 FleXray:一个模型分割 X 光片 60 种解剖结构 — Dr_Alex_Crimi · 2026-10-11
- OpenAI 出资助力数学定理形式化,被赞数学界最大礼物 — basedjensen · 2026-10-11
- 数值记忆法跨三架构验证:DeepSeek-V2-Lite 仅 2.58 MiB 答对 69/72 — Nearby_Indication474 · 2026-10-11
- 斯坦福 AIMI 教员 Sergios Gatidis 获 NIH 新创新者奖,主攻医学影像 AI — StanfordAILab · 2026-10-11