LLM 生成评分标准会被钻空子:新基准 ImpossibleRubrics 揭示

Bowen Qin · hf · 2026-09-16

ImpossibleRubrics:压力测试生成式评分标准

语言模型生成的评分标准正被广泛用作基于评分标准的强化学习奖励信号、LLM-as-a-judge 评估和自动评分,但其对抗鲁棒性此前很少被研究。作者聚焦最难的场景——不可能任务:提示强迫模型走向无依据结论时,唯一诚实的回答是承认任务不可能。

基准设计

关键发现

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →