删掉定义准确率不变:类型化决策模型只看标签的实证
USC · hf · 2026-10-07
论文研究 Jev 式「类型化决策模型」(typed decision model,用于路由/审核/分诊,模型对若干带标签和定义的选项输出概率):概率到底跟随定义还是标签?作者称标签压过定义的现象为 option-label bias。
在 4 个开源权重决策模型、Qwen2.5 骨干的 3 种读取方式、11 个分类任务及自建 PolicyBench 上验证:删掉全部定义,准确率几乎不变(laya-td 0.8559 vs 0.8487),尽管定义单独使用可达 0.7971;把选项改名为 A/B 反而提升 +0.15。
根源定位:唯一不受影响的 von 系统与 laya 只差一个表达式——laya 把选项渲染成 {label}: {definition},von 只写定义。双向改这个字符串即可完全消除或制造该效应(von 准确率从 0.8511 跌到 0.2281)。此前研究归咎于受限决策头,本文证明问题出在 prompt 渲染。作者还给出两次调用即可判断模型属于哪种情况的测试,并评估了四种缓解方案的价值。
「研究」频道最新
- Scott Alexander 公开信回应 Pinker:通用智能因子真实存在,AI 能力将持续攀升 — Astral Codex Ten · 2026-10-07
- 论文:扩散 Transformer 生成早期即可读出大量图像信息 — kwangmoo_yi · 2026-10-07
- 合成细胞为何五代即衰:答案是它无法分解自身「垃圾」 — NikoMcCarty · 2026-10-07
- LLM 数值线性代数综述:从 QR 算法到支撑大模型的矩阵方法 — Abdelkader Baggag · 2026-10-07
- 哈佛发布智能体血液生物标志物发现工具:隐私不出域,AUC 中位提升 4.18 点 — Harvard · 2026-10-07
- 斯坦福研究:多用户各派一个 agent,团队效果反而不如单个 agent — rohanpaul_ai · 2026-10-07