BioSecBench 发布:Opus 与 Grok 位列生物安全基准前二

himanshustwts · x · 2026-08-28

BioSecBench-Function 是一个新的可验证基准,旨在测试 AI 智能体能否从数据中推断病毒、细菌和毒素的功能属性。该基准包含 111 项确定性评估。评测结果显示,在使用 Claude Code 的 Opus 5 在端点通过率上领先(50.4%),而使用 Grok Build 的 Grok 4.6 在计入拒绝回答失败后的总体通过率上领先(44%)。

所属事件:新基准显示 AI 推断病原体功能能力不足 50%(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →