测试6款开源AI安全分类器:无一能可靠拦截生物武器生成

kenbwork · x · 2026-08-07

研究人员在涵盖双重用途、病原体基因组和常规研究等73项生物安全任务上,测试了6款开源AI安全分类器。结果显示,没有任何模型能可靠区分危险工作与合法科学研究。

表现最好的 Llama Guard 4 虽然能拦截76%的红队威胁,但也误杀了55%的合法研究请求。其他分类器的准确率几乎不如抛硬币。例如,Mistral 新发布的 Shieldstral 在准确率最高的阈值下会接受所有请求,拦截率为0%;即使在最激进的设置下,也仅能拦截24%的威胁,同时误杀超半数合法请求。

此外,分类器会不成比例地拦截提及埃博拉、疟疾等已知危险物质的常规工作,且即使做出正确的拒绝,往往也是出于错误的原因。

所属事件:实测开源AI安全分类器:难拦生物武器且误杀合法研究(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →