基因泰克 AutoSciBench:自动生成基准让 agent 准确率降 25 分

Genentech · hf · 2026-10-07

基因泰克发布 AutoSciBench,解决科研 agent 基准随能力提升而饱和、人工构建成本高的问题。框架将任务表示为高层概念(领域、模态、推理方式)+ 低层配方(问题、环境、真值如何构建与验证),让 agent 求解产生轨迹与裁判反馈,据此迭代修订配方、封堵捷径,并把已完成的精炼经验蒸馏出来指导新概念生成。

在计算生物学、材料科学、临床影像三个领域验证:生成基准在计算生物学和材料科学上分别使求解者平均准确率下降 22.4 和 25.5 个百分点,且生成任务质量评分更高,说明科研 agent 评测可随能力进化自动适应。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →