新基准显示 AI 推断病原体功能能力不足 50%
研究人员发布可验证基准 BioSecBench-Function,包含 111 项确定性评估,测试 AI 智能体能否从数据中推断病毒、细菌和毒素的功能属性。背景是新病原体几天内即可检出,但功能表征仍是瓶颈,制约应对措施研发。评测结果显示各模型整体准确率不足 50%,其中 Opus 与 Grok 位列前二。
2026-08-28 ~ 2026-08-28 · 3 条相关
- BioSecBench 基准评测:AI 代理推断病原体属性能力不足 50% — kenbwork · 2026-08-28
- AI 辅助病原体功能表征:新基准填补检测与应对间空白 — kenbwork · 2026-08-28
- BioSecBench 发布:Opus 与 Grok 位列生物安全基准前二 — himanshustwts · 2026-08-28