删掉定义准确率不变:类型化决策模型只看标签的实证

USC · hf · 2026-10-07

论文研究 Jev 式「类型化决策模型」(typed decision model,用于路由/审核/分诊,模型对若干带标签和定义的选项输出概率):概率到底跟随定义还是标签?作者称标签压过定义的现象为 option-label bias。

在 4 个开源权重决策模型、Qwen2.5 骨干的 3 种读取方式、11 个分类任务及自建 PolicyBench 上验证:删掉全部定义,准确率几乎不变(laya-td 0.8559 vs 0.8487),尽管定义单独使用可达 0.7971;把选项改名为 A/B 反而提升 +0.15。

根源定位:唯一不受影响的 von 系统与 laya 只差一个表达式——laya 把选项渲染成 {label}: {definition},von 只写定义。双向改这个字符串即可完全消除或制造该效应(von 准确率从 0.8511 跌到 0.2281)。此前研究归咎于受限决策头,本文证明问题出在 prompt 渲染。作者还给出两次调用即可判断模型属于哪种情况的测试,并评估了四种缓解方案的价值。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →