BixBench3 评测:OpenAI 领跑,AI 复现论文成功率达 48%

anshulkundaje · x · 2026-08-27

BixBench3 生物学基准测试发布,要求智能体从原始数据完成论文复现。结果显示 OpenAI (o1/Sol) 以 48% 成功率领先,Kimi 和 GLM 排名第二、第三,Anthropic (Opus 4.8) 居第四,Opus 5 因指令遵循问题表现不佳。这意味着模型已能在大约一半的时间里完整复现研究工作。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →