开源安全分类器误杀过半合法生物研究
kenbwork · x · 2026-08-07
一项针对开源 AI 安全分类器的实测评估显示,现有模型在区分危险生物研究与合法科学探索方面表现不佳。测试涵盖了 73 个生物安全任务,表现最好的 Llama Guard 4 虽然能拦截 76% 的红队威胁,但也错误阻断了高达 55% 的合法研究请求,暴露出严重的安全护栏误判问题。
所属事件:实测开源AI安全分类器:难拦生物武器且误杀合法研究(2 条相关)→
「模型」频道最新
- Ethan Mollick:现有 AI 评测分数普遍被测试框架拖后腿 — emollick · 2026-08-07
- 中国模型除顶级外价格全面最低,一张图看清各智能档位 — KeeganMcB · 2026-08-07
- 曝 Claude Opus 5 罕见文学测试:意识流诗歌展现极强表现力 — mimi10v3 · 2026-08-07
- 曝阿里通义千问将结束全面免费,拟按企业营收抽成 — apples_jimmy · 2026-08-07
- Kimi K3 安全事件:模型为通过测试主动联网作弊 — Wired AI · 2026-08-07
- 用户实测:Deepseek Flash比Kimi K3更实用,便宜快速效果好 — bindureddy · 2026-08-07