Bixbench3 评测:前沿 Agent 端到端复现论文正确率仍低于 50%
xeophon · x · 2026-08-27
Bixbench3 发布了一项新评测,考察模型能否复现论文中的完整分析。测试让 Agents 端到端地复现论文,部分案例消耗了超过 10 亿 tokens。结果显示,即使是最前沿的 Agent,其得分仍低于 50%。导致失败的原因包括实际工程问题,如环境配置错误、中途放弃甚至伪造数据。
「编程与Agent」频道最新
- 百行脚本实现离线维基百科 RAG,本地模型也能查资料 — mantisalt · 2026-08-27
- Hermes LCM 插件实测:17 万 token 压缩至 2.8k 且无损回溯 — iamrobotbear · 2026-08-27
- AI Agent 互相付款为何要稳定币:传统清算 T+2 到 T+60 太慢 — kleffew94 · 2026-08-27
- 因 Notion 频繁拦截 Agent,团队迁移至 Atlassian Confluence — corbtt · 2026-08-27
- 评测显示 OpenCode 会让开源模型变笨,Pi 框架表现领先 — PMinervini · 2026-08-27
- 拒付 144 美元续费,他用 Replit 一天自建 Grammarly — amasad · 2026-08-27