测试6款开源AI安全分类器:无一能可靠拦截生物武器生成
kenbwork · x · 2026-08-07
研究人员在涵盖双重用途、病原体基因组和常规研究等73项生物安全任务上,测试了6款开源AI安全分类器。结果显示,没有任何模型能可靠区分危险工作与合法科学研究。
表现最好的 Llama Guard 4 虽然能拦截76%的红队威胁,但也误杀了55%的合法研究请求。其他分类器的准确率几乎不如抛硬币。例如,Mistral 新发布的 Shieldstral 在准确率最高的阈值下会接受所有请求,拦截率为0%;即使在最激进的设置下,也仅能拦截24%的威胁,同时误杀超半数合法请求。
此外,分类器会不成比例地拦截提及埃博拉、疟疾等已知危险物质的常规工作,且即使做出正确的拒绝,往往也是出于错误的原因。
所属事件:实测开源AI安全分类器:难拦生物武器且误杀合法研究(2 条相关)→
「模型」频道最新
- 用户实测:Deepseek Flash比Kimi K3更实用,便宜快速效果好 — bindureddy · 2026-08-07
- AI 生成 vs 手动工具:图像生成缺乏迭代过程,难以捕捉艺术敏感性 — snikolov · 2026-08-07
- NVIDIA开源模型采用速度达同级20倍,美国开源AI严重供不应求 — XFreeze · 2026-08-07
- Cloudflare公开Kimi和GLM规模化推理优化:KV缓存量化与权重压缩 — JeremyCMorgan · 2026-08-07
- 多智能体协作实测:修复成本增3倍,代码审查更全面 — Still_Amphibian545 · 2026-08-07
- OpenRouter 被曝静默吞掉推理参数,模型实测成绩大幅失真 — PawelHuryn · 2026-08-07