BixBench3 评测发布:测模型生整篇生物论文分析
ZhongingAlong · x · 2026-08-27
Edison Sciences 发布 BixBench3,这是一个专注于生物科学的长周期评测基准。它旨在衡量模型从原始数据生成整篇生物学论文背后的分析能力。
- 任务规模:包含 20 个源自论文的任务,数据集规模最大达 241 GB,是目前已知跨度最长的生物学基准。
- 评测对象:测试了 13 个前沿模型。
- Agent 工作流:任务模拟了科学家使用 Agent 的流程——设定目标、规划方法,并委托 Agent 实施。
- 结果:表现最好的模型平均能复现 48% 的请求产物,表明 Agent 正接近研究级能力,但仍需改进。
所属事件:BixBench3 发布:前沿 AI 复现生物论文成功率约 48%(4 条相关)→
「研究」频道最新
- 新基准实测:AI 智能体漏看四分之一的互联网 — EXM7777 · 2026-08-27
- 专家小组预测AI走向:半导体股价、数据中心投资与OpenAI/Anthropic营收 — scaling01 · 2026-08-27
- 开源 LLM 交易实验招募,探索模型自我提升 — n1c39uy · 2026-08-27
- AI 智能体群体规模越大越难对齐? — Hidenori8Tanaka · 2026-08-27
- Apodex 1.1 发布:面向 Agent 智能的模型与 FrontierAgent 框架 — wuqiao · 2026-08-27
- 离散扩散模型 DTCR 按靶点设计 T 细胞受体,可泛化到未见免疫目标 — bravo_abad · 2026-08-27