实测开源模型「决策打分」:比生成概率快 7 至 54 倍
vykthur · x · 2026-09-27
作者探究了 Jev 这类「决策模型」如何在毫秒内返回带概率的答案,以及概率是否校准,并在开源 Qwen2.5 1.5B 与 7B 上做了实验,写了交互式文章。
决策模型的工作流程分四步:
- 定义决策:一个状态加一组选项;
- 把它写成一句待补全的句子,选项附在末尾;
- 把每个选项作为补全并行打分(不生成文本);
- 归一化分数,选最高者为决策。
在开源模型上的三个有趣结果:
- 打分比让模型生成概率快 7 到 54 倍;
- (其余结果见原文)。
「编程与Agent」频道最新
- 开发者自嘲变「Yes 开发机」,求关掉 VS Code Claude 插件确认弹窗 — ThePeterMick · 2026-09-27
- 模型路由评测缺位遭群嘲,Elvis Saravia 呼吁做真正的好基准 — omarsar0 · 2026-09-27
- Opus 5.5 编年史诗级 prompt:代码逐帧渲染《中华文明史》 — dotey · 2026-09-27
- Meta Muse 为每个用户配独立 VM,被评最谨慎消费级 Agent 沙箱 — AccBalanced · 2026-09-27
- 让 Agent 免审代码:SafeScript 用可静态验证的 JS 子集审核策略 — uriwa · 2026-09-27
- 开源 AI-SQL 引擎 Quail 走红:任务专用模型让生产级 AI 更省更准 — sh_reya · 2026-09-27