模型评估论文:区分能力评测与倾向评测

sjgadler · x · 2026-08-30

该帖讨论了 arXiv 论文《Model evaluation for extreme risks》。作者指出,相关测试旨在准确测量模型能力(如网络攻击、操纵技能),以便后续应用缓解措施(分类器、拒绝训练等)。这是「能力评估」而非「倾向评估」,目的是识别危险能力而非模型是否会拒绝任务。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →