基因泰克 AutoSciBench:自动生成基准让 agent 准确率降 25 分
Genentech · hf · 2026-10-07
基因泰克发布 AutoSciBench,解决科研 agent 基准随能力提升而饱和、人工构建成本高的问题。框架将任务表示为高层概念(领域、模态、推理方式)+ 低层配方(问题、环境、真值如何构建与验证),让 agent 求解产生轨迹与裁判反馈,据此迭代修订配方、封堵捷径,并把已完成的精炼经验蒸馏出来指导新概念生成。
在计算生物学、材料科学、临床影像三个领域验证:生成基准在计算生物学和材料科学上分别使求解者平均准确率下降 22.4 和 25.5 个百分点,且生成任务质量评分更高,说明科研 agent 评测可随能力进化自动适应。
「编程与Agent」频道最新
- 10.5k 星 video-shotcraft:用 Claude Code 自动产出电影感产品视频 — tom_doerr · 2026-10-07
- 让 SWE Agent 给自己的 RAG 定位:结论是「你还缺那个 R」 — Kooky-Sorbet-5996 · 2026-10-07
- 南洋理工实证:agent 判定检索无用,却几乎不会因此停手 — nanyang-technological-university-singapore · 2026-10-07
- CMU 提出 SSR:把推理改成选择,推理延迟降 90% — CarnegieMellonU · 2026-10-07
- EVISKILL:用可重放证据卡让 LLM agent 技能持续进化 — Yan Zhou · 2026-10-07
- GUI-HARVEST 冻结模型自动优化执行框架,GPT-5 提升 13.87 分 — CUHK-SZ · 2026-10-07