开源安全分类器误杀过半合法生物研究

kenbwork · x · 2026-08-07

一项针对开源 AI 安全分类器的实测评估显示,现有模型在区分危险生物研究与合法科学探索方面表现不佳。测试涵盖了 73 个生物安全任务,表现最好的 Llama Guard 4 虽然能拦截 76% 的红队威胁,但也错误阻断了高达 55% 的合法研究请求,暴露出严重的安全护栏误判问题。

所属事件:实测开源AI安全分类器:难拦生物武器且误杀合法研究(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →