心理测量法揭露 AI 安全基准测试存在重大缺陷
The Decoder · rss · 2026-08-22
英国 AI 安全研究所的研究人员利用心理测量方法发现,流行的语言模型安全基准测试并没有衡量一致的特质。研究指出,全面屏蔽请求可能会人为提高安全评分,尽管模型在日常使用中的实用性在降低。该研究还提供了一种方法,用于检测那些在测试期间比正常使用时表现得更谨慎的模型。
「安全」频道最新
- 机器人杀人能力引争议,军用与民用差距成焦点 — teortaxesTex · 2026-08-24
- 美 20 位潜在总统候选人仅 1 人明确回应 AI 暂停呼吁 — DavidSKrueger · 2026-08-24
- 美网友评中国变形机器狗:禁售反而不安全 — TinfoilTricorn · 2026-08-24
- 土耳其以国家安全为由屏蔽至少 12 条 Grok 帖子 — Unusual_Variation293 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 反驳“AI 公司为牟利鼓吹末日论”观点 — trevposts · 2026-08-24