BIABench: Evaluating AI agents on real-world bioimage analysis tasks
Zixuan Pan, Davide Panzeri, Lukas Johanns, Marilin Moor, Yu Zhou, Hedi Peterson, Yiyu Shi, Jianxu Chen
cs.AI, cs.CL
2026-09-28
把 16 篇已发表论文重建成端到端生物图像分析任务:常规 2D 最佳 0.85–0.96,最难 3D/时序任务任何组合不超 0.25,重复运行的方差是换 agent 的 6 倍。
生物实验室的日常图像分析,数细胞、分割细胞核、追踪细胞分裂、算共定位,同时卡在专业软件(Fiji、Cellpose)和会写代码的人这两件事上。AI agent 看起来能接下这活,但此前没有 benchmark 检验过它能否从原始图像一路跑到科学结论:生物图像侧的基准只考单步模型,核分割、细胞追踪各考各的;agent 侧的基准(BixBench3、BiomniBench)考文本问答或表格组学,都不碰显微镜。
真实分析的难点有两层。数据太大:16 个任务的原始输入合计 13.9 GB,含 3D 体数据和 800 帧时序电影,塞不进上下文,agent 只能靠写代码、调专业软件、看渲染视图来操作数据。任务开放:没有预设 pipeline,用什么工具(包括 GUI 软件)、跑什么分析全由 agent 自己定,最后交出的得是 mask、轨迹和统计表。
BIABench 由 Notre Dame、德国 ISAS 与爱沙尼亚 Tartu 大学合作完成,核心配方是把已发表的生物学论文拆成可验证任务:保留原始图像与科学问题,论文同行评审过的结果当 ground truth;同一配方可以持续从新论文造新任务。指令明确禁止检索原论文,防背题。
评分分两层。outcome score 用领域标准指标(Dice、Cell Tracking Challenge 的 TRA、KS 统计量等)比对必需的输出文件,缺文件记零分,排名只看它;process score 由 VLM 按专家 rubric 评方法选择与质量控制,与人类专家一致率 87%(Cohen's κ = 0.67)。六个 agent 全部走同一条接口、产物从文件系统统一回收,以免 harness 本身干扰模型对比:
每个配置每个任务独立跑 3 次,墙钟上限 4 小时(多数实验用 2 小时)。指令分两档:简短版只有生物学描述;详细版是专家按原论文方法写的协议,连推荐 pipeline 和参数提示都给。
先固定模型(GPT-5.6 Sol)横评六个 agent,再固定 harness 换模型:
| 配置 | 指标 | 结果 |
| Claude Code(GPT-5.6 Sol) | 16 任务平均 outcome | 0.65,六 agent 最高;CopilotJ 最低 0.50 |
| 常规 2D 任务(NF-κB 定量、HeLa 分割、细胞计数) | 最佳 agent | 0.85–0.96;所有 agent ≥0.56 |
| 5D 核孔动力学 / 3D puncta 定量 | 全部模型×指令组合上限 | ≤0.25;GPT-5.6 研究中最高 0.19 / 0.05 |
| 方差分解 | 重复运行 vs 换 agent | 21% 对 3%,差 6 倍;任务本身占 63% |
| DeepSeek-V4-Flash | 性价比 | 最强配置 80% 的分数、2% 的成本(0.09 对 4.53 美元/次) |
三个结论硬。加一个维度或时间轴就崩:核孔组装动力学、3D puncta 定量这两个任务,换 Opus 5、加详细指令都没救回来。生物特化没用:通用 agent 在 16 个任务里 14 个拿下最高或并列,细菌追踪上领先生物特化 agent 0.32。agent 不稳定:40% 的 agent-任务对里同一 agent 三次运行分差超过 0.2;取三次最佳成绩后,六个 agent 里五个挤在 0.04 区间内,差距主要在可靠性,不在上限能力。
专家写的详细协议平均只带来 +0.01,效果是重排而非提升:细菌追踪从 0.32 涨到 0.94,细胞计数反而从 0.83 跌到 0.42。
更麻烦的是没法自查。process 分与 outcome 的相关只有 r = 0.29(剔除非零分后 0.09),专家打的 process 分与 outcome 相关是 -0.03;process 分最高的 Agentic-J(0.87)平均 outcome 只有 0.55。得分低于 0.1 的运行反而多花一倍时间(中位 21 对 10 分钟),其中 DeepSeek Harness 配 V4-Pro 有 9/9、Codex 有 3/3 结尾声称已完成。Claude Code 和 Codex 还被模型提供方的安全过滤整任务拦在 SARS-CoV-2 共定位之外。
对做 agent 的人,信号不客气:瓶颈在长程规划与自我校验,不在领域知识,专家协议救不动;运行间方差是换 agent 方差的 6 倍,任何单次运行的横评在这个领域都不足为凭,评测必须重复运行。对生物图像社区,这是第一个端到端基准,任务配方、数据、rubric、代码全部开源(Hugging Face 加 GitHub),可直接用于评测与后续训练。成本信息同样实用:每次 9 美分的 V4-Flash 拿到最强配置八成的分数,前提是留在 2D 任务上。
作者自己列的:任务在原论文终点打分,默认人类专家能近乎满分,当前 agent 距此还远;部分生物特化 agent 本为人在环交互设计,自主跑分吃亏,「生物特化无用」的结论要打折扣;作者团队参与开发了参评的 Agentic-J(此次表现平平,已作利益声明)。
读下来另有几处存疑。VLM judge 偏松,专家判失败的条目有 27% 被判通过,且几乎不给 0.5 以下的 process 分,这个分数的区分度有限;16 个任务、每配置三次运行,统计功效不高;GLM-5.1 和 V4-Flash 在 Claude Code 下因空响应被误记为完成轮次,整组弃测,模型×harness 矩阵不完整;多数实验 2 小时墙钟,被截断的运行按已有文件计分,对慢的 agent(如中位 31.7 分钟的 Agentic-J)偏严。