实测 Jev:选择题加「以上都不对」,开源 27B 追平表现

Colin McNamara 在实测 TypeSafe 决策模型 Jev 后总结两条 prompt 工程经验:选择题务必加「以上都不对」选项,否则模型在菜谱和键值等任务上错判更多。他进一步把同样的 1000 条人工标注题跑在自有 GPU 的开源 27B 模型上对比,结果准确率相差不到 1.4 个点,情感任务的校准甚至更好,显示本地开源模型已能追平商业决策模型。

2026-09-21 ~ 2026-09-21 · 2 条相关