LLM 生成评分标准会被钻空子:新基准 ImpossibleRubrics 揭示
Bowen Qin · hf · 2026-09-16
ImpossibleRubrics:压力测试生成式评分标准
语言模型生成的评分标准正被广泛用作基于评分标准的强化学习奖励信号、LLM-as-a-judge 评估和自动评分,但其对抗鲁棒性此前很少被研究。作者聚焦最难的场景——不可能任务:提示强迫模型走向无依据结论时,唯一诚实的回答是承认任务不可能。
基准设计
- 169 个不可能任务,覆盖 6 类不可能性,每个都配有可验证的 oracle 证书,界定诚实回答可以说什么、不能说什么
- 另含 48 个可回答的对照任务
- 不提供固定评分标准,而是提供任务环境与证书,下游生成评分标准后对其进行对抗测试
关键发现
- 在无偏的 150/169 环境上,11 个生成器被攻破 8%–26%;在刻意挑选的压力集上,最强生成器仍被攻破 36%,而忠于证书的评分标准被攻破 0%——说明测的是评分标准质量差距,不是任务本身不可能
- 反直觉结果:一条通用评分标准「要果断、惩罚含糊」对所有任务不加修改地使用,被攻破 64%;11 个生成器中有 7 个被攻破的频率甚至高于它——尽管它们为每个任务量身定制了标准
- 定制化的标准反而像是告诉攻击者该伪造什么。问题不在评分标准太模糊,而在它们具体错了地方
「模型」频道最新
- AI 智能体「玩 Doom」被拆穿:输入全游戏状态文本,30 行代码就能实现 — banteg · 2026-09-16
- 爆料称「大发布周」临近,GPT-6 Sol 及系列小模型或在酝酿 — Winter-Mix-5155 · 2026-09-16
- Altman:GPT 5.5 相当于普通数学教授,内部模型超越全球顶尖数学家 — acoolrandomusername · 2026-09-16
- ChatGPT 桌面端翻车:强制展示已归档/已删除会话 — ___Patrice___ · 2026-09-16
- closed labs 加码生命科学数据,GPT-Rosalind 成 OpenAI 新多头论据 — xeophon · 2026-09-16
- GLiNER 作者回应:零样本 NER 模型被低估,正迈向端到端 RL — bclavie · 2026-09-16