KoNA 基准:让视觉语言模型学会「哪些请求不该照办」

POSTECH · hf · 2026-09-08

POSTECH 提出 KoNA(Knowing What Not to Answer),评估视觉语言模型在混合查询中的选择性不服从能力——即判断哪些请求应当拒绝执行。团队还通过针对性微调提升了模型在合理拒答与合规执行之间的平衡。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →