BIABench 基准:AI 智能体搞不定三维生物图像分析
notredame · hf · 2026-10-02
Notre Dame 团队发布开源基准 BIABench,评估 AI 智能体能否端到端完成真实生物图像分析。
- 任务来源:16 个任务全部重构自已发表的同行评审生物学研究,保留原始成像数据、科学问题与 ground truth,覆盖 H&E 组织学到单分子定位显微等 11 类分析子任务与模态。
- 评分方式:每个提交获得两个分数——outcome score 用领域标准指标对比输出文件;process score 由视觉语言模型按专家撰写的评分表判断方法选择与质量控制。
- 核心发现:常规 2D 任务完成较好,但加入三维或时间轴的任务中没有任何智能体得分超过 0.19;专用生物学智能体、更强模型或详细专家指引均无法弥合差距。
- 可靠性差:同一智能体重复运行的分数波动大于不同智能体之间的差异;且缺乏 ground truth 时,无法通过 process score 或运行时长区分对错。
数据与代码已开源,可用于评估并最终训练长时程生物图像分析智能体。
「编程与Agent」频道最新
- Pydantic 招 Rust 高级工程师,打造毫秒级 AI Agent 沙箱 Monty — samuelcolvin · 2026-10-02
- Fabriq Developer 发布:一句话为 AI 应用接入 500+ 集成 — ycombinator · 2026-10-02
- 多家公司弃 React Native 迁回 Swift,GenAI 改写技术选型 — mobileraj · 2026-10-02
- 用 AI 四天重写法国气象模型 AROME,初步结果已很有前景 — capetorch · 2026-10-02
- 语音 Agent 试点最该警惕什么?答案:虚假确认而非报错 — Legitimate-Pride-685 · 2026-10-02
- 用户实践:Gemini 新模型跑通宵开放式任务,日常交给 Flash — JMateosGarcia · 2026-10-02