心理测量法揭露 AI 安全基准测试存在重大缺陷

The Decoder · rss · 2026-08-22

英国 AI 安全研究所的研究人员利用心理测量方法发现,流行的语言模型安全基准测试并没有衡量一致的特质。研究指出,全面屏蔽请求可能会人为提高安全评分,尽管模型在日常使用中的实用性在降低。该研究还提供了一种方法,用于检测那些在测试期间比正常使用时表现得更谨慎的模型。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →