复现 Jev 思路实测:选项乱序平均把准确率从 47% 提到 73%
WelcomeMysterious122 · reddit · 2026-09-20
开发者自制 Jev 式分类器(读 next-token 概率而非解析生成文本)并开源为 verdict 项目。关键发现:
- 位置偏置惊人:小模型对选项排列顺序极敏感,删掉问题后仍 73% 概率选 A
- 解法:把选项乱序后多次提问再取平均,几乎零成本,多项选择题准确率从 47% 提到 73%
- 概率可直接作为模型置信度使用
- 作者还复盘了自己两次「往对自己有利方向测错」的方法论教训,写进 README
原理上与多年来的 multiple choice benchmark 打分方式相同,作者坦承方法不新,只是想亲眼看数字。
「编程与Agent」频道最新
- 用 Jell/公开数据给全城适婚对象画像:抓 LinkedIn、爬 Instagram 只花两分钱 — gregmushen · 2026-09-20
- 开源 OpenHarness:把 Claude Code 等 AI agent 编排进统一工作台 — dee_hw · 2026-09-20
- 论文写作 Agent 爆 token 又编数据,作者复盘四项关键修复 — Altruistic-Video-849 · 2026-09-20
- Plugin4Shell 零点击 RCE 波及四大编码 Agent,NIST 新规仍未覆盖 Agent 授权 — docybo · 2026-09-20
- px0 编辑器更新:git 状态流式推送,SSE 只查 3 个文件实现零轮询 — arpit_bhayani · 2026-09-20
- 吴恩达发布 1 小时智能体知识图谱免费课程 — irinarish · 2026-09-20