一个是非问题测出对齐失败:AUROC 0.886,成本仅为 LLM 评审 1/60

omarsar0 · x · 2026-09-28

一项新工作展示了用 TypeSafe AI 的校准决策模型 Jev 检测模型对齐失败的巧妙方法:

Jev 的核心设计是单次调用内对同一输入回答多个带类型的问题,每个都输出概率。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →