GamowLabs 发布 LabBench:AI agent 难以选对下一个关键实验

danielmckinn0n · x · 2026-09-30

GamowLabs 的机器人生物学实验室发布公开基准 LabBench,评估 AI agent 规划与解读湿实验(wet-lab)数据的能力。数据集全部来自真实实验室数据、未公开于互联网。

核心发现:尽管 agent 在评测的其他环节展现出相当的领域知识与专业度,它们却难以「果断选择下一个最重要的实验」——即在实际实验决策这一步表现不佳。团队希望借此推动用 AI 提升湿实验的速度与效率,博客与预印本已发布。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →