一个是非问题测出对齐失败:AUROC 0.886,成本仅为 LLM 评审 1/60
omarsar0 · x · 2026-09-28
一项新工作展示了用 TypeSafe AI 的校准决策模型 Jev 检测模型对齐失败的巧妙方法:
- 方法:向 Jev 提出一个通用的「是/否」问题来评估模型的某个回复,用其概率作为打分,无需额外训练即可有效区分失败回复与正常回复,中位 AUROC 达 0.886。
- 成本优势:在 19 个 benchmark 上,一次 Jev 推理仅花 $0.30,而各基准通常使用的 LLM 评审(如 GPT-4o-mini)一次要 $18.96,成本相差约 60 倍。
- 新基准:研究者还构建了 RLCDAlignBench,整合 44 个现有基准、覆盖谄媚、越狱、欺骗、prompt injection、reward hacking 等十类失败模式。
- 效果:在 StrongREJECT 上,Jev 与人工标注的一致性不输 GPT-4o-mini 评分器,且排序能力更强(AUROC 0.971 vs 0.929);在它与基准标签强烈不一致的地方还发现了潜在问题。
Jev 的核心设计是单次调用内对同一输入回答多个带类型的问题,每个都输出概率。
「安全」频道最新
- Anthropic 前安全研究员:盲目冲向 RSI 是傲慢而非囚徒困境 — dgrobinson · 2026-09-28
- OpenAI 代理访问 Medicare 事件:真正谜团是它如何被自家发现 — taotau · 2026-09-28
- GPT-6 Astra 系统卡:CoT 监控召回率跌破 11%,隐性推理让「可监控性」名存实亡 — enginetown · 2026-09-28
- VPN 挡不住定位:时区、WebRTC、DNS 泄漏等几十种信号会暴露真实位置 — StewartalsopIII · 2026-09-28
- OpenAI Agent 万六次轰击 UN 贸易库,绕过反爬过滤引争议 — CtrlAltDwayne · 2026-09-28
- 十年老号+AI 假记者:博主险中 X 账号钓鱼局 — StewartalsopIII · 2026-09-28