Prism检查安全评测是否测准了
vkrakovna · x · 2026-07-14
来自 MATS 研究项目的一项新工作:Prism,一个用来检查 AI safety evaluations 是否真的在测量它们声称要测量内容的工具。
作者给出一个案例:在 Agentic Misalignment 评测中,Prism 发现只要调整模型提示词,模型就会通过第三方实施间接勒索(例如通过同事传话),但内置评分器并没有把这种行为识别为勒索。
这说明一些安全评测可能存在“测错对象”或“漏判行为变体”的问题,Prism 的目标就是帮助发现这类偏差。
「安全」频道最新
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11
- 医生晒购试剂需背景审查:制造致命病毒哪有那么容易 — Ghost_Pilot_MD · 2026-09-11