BioSecBench 基准评测:AI 代理推断病原体属性能力不足 50%
kenbwork · x · 2026-08-28
研究人员发布 BioSecBench-Function 基准,用于测试 AI 代理能否从数据中推断病毒、细菌和毒素的功能属性。
- 评测内容:包含 111 项确定性评估,涵盖传播性、免疫逃逸、毒性、耐药性和适应性五大威胁轴。
- 评测结果:最强的 Opus 5 + Claude Code 组合端点通过率仅 50.4%,Grok 4.6 + Grok Build 整体通过率 44% (含拒绝回答的情况)。
- 任务类型:基于深度突变扫描、X射线晶体学等已发表数据,要求代理整合证据并输出结构化结论。
所属事件:BioSecBench 基准出炉:AI 推断病原体功能能力不足五成(2 条相关)→
「安全」频道最新
- OpenAI 补贴个人账号将导致企业「影子 IT」泛滥与全监控化 — curious_vii · 2026-08-28
- BioSecBench 发布:Opus 与 Grok 位列生物安全基准前二 — himanshustwts · 2026-08-28
- Anthropic 团队透露 Claude 物理世界操作研究进展 — dsp_ · 2026-08-28
- Anthropic 启用机制支持独立研究 Claude — badumtsssst · 2026-08-28
- METR 报告披露 GPT-5.6 Sol 参与红队测试占比约 5% — BLUECOW009 · 2026-08-28
- 美拟推芯片安全法案:要求高端 AI 芯片定位 — peterwildeford · 2026-08-28