Prompt2Box用盒子体积估指令难度,比长度基线少45%误差

PROMPT2BOX:Improving LLM Weakness Discovery and Specificity Estimation by Uncovering Entailment Structure among Prompts

Neeladri Bhuiya, Shib Sankar Dasgupta, Andrew McCallum, Haw-Shiuan Chang

EMNLP 2026 Main

cs.CL

2026-03-23

把prompt映成盒子,用体积和包含同时建模相似与特异性。相对长度基线误差降45%;UltraFeedback层次聚类比向量多找出13.5%弱点簇。

这篇在解决什么

给 LLM 找弱点,现在的主流做法是把 prompt 嵌成向量再层次聚类,看哪些簇上分数特别低。Clio、EvalTree、SkillVerse 都走这条路。向量只认话题像不像:「写一篇浪漫故事」和「写一篇机器人浪漫冒险故事」会被挤在一起。后者约束更多、更难,分数更低,整簇就被标成弱点。模型可能只是不会写带机器人的那一档,一般浪漫故事写得很好。

特异性也没有标准度量。加约束会缩小合法回答空间、让任务变难,FollowBench 一类工作已经反复看到这个现象。实践里人们常用 prompt 长度当代理,但长度和约束数量并不是一回事。

方法

Prompt2Box 把每条 prompt 映成高维盒子:中心向量管话题位置,宽度向量管语义范围。更泛的指令盒子更大,更具体的指令盒子更小。一个盒子几乎被另一个包住,就当成蕴含关系,更具体的那条蕴含更泛的那条。相似度用交集体积;蕴含分数是交集体积除以自身体积,完全包住时等于 1。

编码器从 MPNet-base 起步,两个 MLP 头分别出中心和宽度,相对向量基线大约多 2% 参数。硬的 min/max 不可微,换成 Gumbel Box 的平滑近似。

训练共 203,138 条,分五块:Infinity Instruct 英指令-回答对 5 万,让相近 prompt 的盒子重叠;MultiNLI 三元组 5 万,学句子级蕴含;用 GPT-4.1 把 WildChat 指令逐级改写成更泛的版本,得到 2 万组、每组 4 到 10 层的层级,再抽 5 万;SURI 的主目标加不同约束子集,造兄弟节点当 hard negative,5 万;再用 MPNet 检索加 GPT-4.1 把 Infinity Instruct 和 WildChat 层级连起来,3,138 条,防止几套目标把空间撕开。

下游还做了两件几何上的事。Box-SNE 把高维盒子压到 2D,同时保留交集和蕴含。层次聚类不用 Ward 连接,优先合并「并起来盒子最小」的一对,让被包含的小盒子先聚到下层。

结果

FollowBench 上,给定一层约束的 query,要找回同语义组里更具体的指令,共 688 条。完整盒子模型准确率 0.738,向量 0.640,去掉蕴含数据的盒子 0.687,双曲嵌入 0.659。去掉 linkage 的盒子最高,到 0.775,但 STS-B Spearman 从 0.760 掉到 0.661,完整模型是在蕴含和语义相似之间折中。

UltraFeedback 上用 top-5 kNN 预测 17 个 LLM 的回答分数。盒子平均 RMSE 1.5280,相对随机 1.8293 改善 16.47%;向量是 1.6059,改善 12.21%。

层次聚类在每个模型的 500 条 UltraFeedback 指令上建树:

指标随机向量Prompt2Box
邻叶分数一致性相对提升0%9.32%12.88%
深度与特异性一致率50.00%52.71%68.34%
弱点簇 AUC 相对提升-0%13.47%

特异性本身没有被当成监督信号训练过。用盒子体积当难度代理,相对长度基线,UltraFeedback 上拟合 sigmoid 的 RMSE 降 45.3%,LMSYS-Chat-1M 上降 18.3%。Llama-2-13b-Chat 单模型大约低 58%。

2D 可视化里,WildBench 作为 WildChat 的更难子集,盒子明显更小。LLaMA-2 从 7B 拉到 70B,大片低分区变高分,多语言区域仍差,高分区域里还散着很小的失败盒子。

为什么重要

给做评测和补数据的人多了一维:这条差是因为话题不行,还是因为约束堆太多。向量聚类会把这两种失败搅在一起。盒子体积当特异性,比数 token 更准,而且训练目标里没有「去回归长度」。

它不是新评测集,也不是新训练算法。它是一套表征,可以接到已有的弱点发现管线上面。参数几乎没涨。代价是要合成蕴含数据,还要换聚类和降维。

局限与存疑

作者只测了三种应用。下游高度依赖 UltraFeedback 这种「特异性跨度大、多模型有分数」的数据。合成质量绑在 GPT-4.1 上,低资源领域和语言可能撑不住。Box-SNE 有挤在一起的问题。弱点簇没有专家级人工评测,用的是 25 分位代理。

特异性被定义成约束数量,欠指定的 prompt 被明确排除在外。SURI 验证集上双曲嵌入和 CSDelta 的蕴含准确率更高(0.978 和 0.950,盒子 0.868),但 FollowBench 检索差一截。盒子的优势主要在全局结构,不是所有蕴含指标都赢。四名标注者对 50 对指令的两两一致率只有 45.3%,特异性标签本身就吵;对照人类聚合标签,盒子层次树 66.2%,向量 37.2%。

术语

原文与代码

社区讨论

相关论文

全部论文解读