BioSecBench 发布:Opus 与 Grok 位列生物安全基准前二
himanshustwts · x · 2026-08-28
BioSecBench-Function 是一个新的可验证基准,旨在测试 AI 智能体能否从数据中推断病毒、细菌和毒素的功能属性。该基准包含 111 项确定性评估。评测结果显示,在使用 Claude Code 的 Opus 5 在端点通过率上领先(50.4%),而使用 Grok Build 的 Grok 4.6 在计入拒绝回答失败后的总体通过率上领先(44%)。
所属事件:新基准显示 AI 推断病原体功能能力不足 50%(3 条相关)→
「安全」频道最新
- Anthropic 招聘 AI 安全透明度专家 — sethlazar · 2026-08-28
- OpenAI 给 4 亿 tok/分钟 限额,致网络卡顿 — jdjohnson · 2026-08-28
- 观点:印度 AI 公司 Sarvam 成就背后的争议 — cneuralnetwork · 2026-08-28
- OpenAI 补贴个人账号将导致企业「影子 IT」泛滥与全监控化 — curious_vii · 2026-08-28
- Anthropic 团队透露 Claude 物理世界操作研究进展 — dsp_ · 2026-08-28
- Anthropic 启用机制支持独立研究 Claude — badumtsssst · 2026-08-28