新基准显示 AI 推断病原体功能能力不足 50%

研究人员发布可验证基准 BioSecBench-Function,包含 111 项确定性评估,测试 AI 智能体能否从数据中推断病毒、细菌和毒素的功能属性。背景是新病原体几天内即可检出,但功能表征仍是瓶颈,制约应对措施研发。评测结果显示各模型整体准确率不足 50%,其中 Opus 与 Grok 位列前二。

2026-08-28 ~ 2026-08-28 · 3 条相关