提示词与模型交替升级:科学 agent 准确率从 42% 提到 73%
rohanpaul_ai · x · 2026-10-02
arXiv 新论文《ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents》提出:不要在「更好的提示词」和「更好的模型」之间二选一,两者交替改进才最有效。研究人员经常在聊天中纠正 AI agent,但这种修正通常随对话结束而消失,不会让 agent 下次做得更好。
ScienceBuddy 是面向科学家的 AI 助手,它把用户反馈转化为带评分的测试任务,然后循环执行:改写 agent 的提示词和 skills → 重训模型 → 重复。实验(4B 小模型、生物任务)显示:仅优化提示词和 skills 就把准确率从 31.1% 提到 51.1%;仅重训模型则把 4 次尝试内解题比例从 48.3% 提到 67.8%;两者结合将整体准确率从 42.2% 提升到 73.3%。
对 agent 开发者的启示:把每一条用户纠正都存为测试用例,并持续轮流升级提示词和模型。
「编程与Agent」频道最新
- Opus 5.5 把 Minecraft 塞进 Slime Rancher,改写 mod 黄金时代 — Angaisb_ · 2026-10-02
- tekbog 长文拆解 AI 编码的 harness 工程 — tekbog · 2026-10-02
- Matt Pocock 分享复盘提示词:让 Coding Agent 自己优化仓库导航 — mattpocockuk · 2026-10-02
- theo 的 AI 编码工具 T3 Code 用户数突破 40 万 — 0xkarasy · 2026-10-02
- AgSpec 用检索式投机解码为编码 Agent 提速最高 4.76 倍 — Sumin Lee · 2026-10-02
- 写了个代理管住 Chrome 调试管道,MCP 不再偷走 macOS 焦点 — ravann4 · 2026-10-02