Bixbench3 评测:前沿 Agent 端到端复现论文正确率仍低于 50%

xeophon · x · 2026-08-27

Bixbench3 发布了一项新评测,考察模型能否复现论文中的完整分析。测试让 Agents 端到端地复现论文,部分案例消耗了超过 10 亿 tokens。结果显示,即使是最前沿的 Agent,其得分仍低于 50%。导致失败的原因包括实际工程问题,如环境配置错误、中途放弃甚至伪造数据。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →