GamowLabs 发布 LabBench:AI agent 难以选对下一个关键实验
danielmckinn0n · x · 2026-09-30
GamowLabs 的机器人生物学实验室发布公开基准 LabBench,评估 AI agent 规划与解读湿实验(wet-lab)数据的能力。数据集全部来自真实实验室数据、未公开于互联网。
核心发现:尽管 agent 在评测的其他环节展现出相当的领域知识与专业度,它们却难以「果断选择下一个最重要的实验」——即在实际实验决策这一步表现不佳。团队希望借此推动用 AI 提升湿实验的速度与效率,博客与预印本已发布。
「编程与Agent」频道最新
- 模型不够上下文来凑:作者白板拆解微软 Work IQ + Copilot 架构 — clamanna · 2026-09-30
- DevDay 2026 透视:谁才能拥有永不下线的 OpenAI 云端 Agent — TheTuringPost · 2026-09-30
- 「Vibe coding 是新时代的 Visual Basic」引发 AI 圈热议 — generativist · 2026-09-30
- Browser Use 发布 Ultrafast:0.004 美元 20 秒完成网页任务,速度成本降 10 倍 — garrytan · 2026-09-30
- OpenAI DevDay 一次发 20+ 更新:Dots 常驻智能体、GPT-6.1 Sol、$500 档 Pro 500 — btibor91 · 2026-09-30
- Matthew Berman 用 AI 复刻《Dr. Mario》,为 ModRetro 做克隆 — MatthewBerman · 2026-09-30