实测决策模型 Jev:两条 prompt 工程经验与本地 27B 对比
colinmcnamara · x · 2026-09-21
作者 Colin McNamara 测试 TypeSafe 的决策模型 Jev 后总结两条实用经验:
- 选择题务必加「以上都不对」选项:没有该选项时,模型对菜谱问题和键盘乱码仍会强行选出一个答案。
- 不要跨题做代数运算:一个与其严格否定形式互为镜像的问题,两者得分之和达 1.19,说明分数不能当作概率直接运算。
作者还将同样的 1000 条人工标注数据跑在自有 GPU 上的开源 27B 模型上:准确率接近(差距 1.4 个点以内),情感任务上校准误差 0.04 对 0.09,速度上 Jev 快 1.8 到 4.5 倍。
所属事件:实测 Jev:选择题加「以上都不对」,开源 27B 追平表现(2 条相关)→
「模型」频道最新
- 博客解析 YOCO 与跨层 KV 共享,涉及 DeepSeek-V4.1-Flash 与 Gemma 4 — donglixp · 2026-09-21
- 曝 Gemini 4.0 在路上:Pro 一年一更,Flash 或月度迭代 — haider1 · 2026-09-21
- SemiAnalysis 创始人:中国多家实验室将转向闭源,开源正在消亡 — ns123abc · 2026-09-21
- DeepSeek 网页版文风被指遭安全对齐「脑叶切除」 — Old_Let6328 · 2026-09-21
- JEV 取消 waitlist 开放:5 美元额度、输入仅 0.042 美元且输出免费 — op7418 · 2026-09-21
- ChatGPT 20x Max 用户吐槽限额收紧:怀疑算力优先给了政府和 API — BopSupreme · 2026-09-21