实测 Jev:选择题加「以上都不对」,开源 27B 追平表现
Colin McNamara 在实测 TypeSafe 决策模型 Jev 后总结两条 prompt 工程经验:选择题务必加「以上都不对」选项,否则模型在菜谱和键值等任务上错判更多。他进一步把同样的 1000 条人工标注题跑在自有 GPU 的开源 27B 模型上对比,结果准确率相差不到 1.4 个点,情感任务的校准甚至更好,显示本地开源模型已能追平商业决策模型。
2026-09-21 ~ 2026-09-21 · 2 条相关
- 开源 27B 本地模型准确率追平 Jev,校准还更好 — colinmcnamara · 2026-09-21
- 实测决策模型 Jev:两条 prompt 工程经验与本地 27B 对比 — colinmcnamara · 2026-09-21