提示词与模型交替升级:科学 agent 准确率从 42% 提到 73%

rohanpaul_ai · x · 2026-10-02

arXiv 新论文《ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents》提出:不要在「更好的提示词」和「更好的模型」之间二选一,两者交替改进才最有效。研究人员经常在聊天中纠正 AI agent,但这种修正通常随对话结束而消失,不会让 agent 下次做得更好。

ScienceBuddy 是面向科学家的 AI 助手,它把用户反馈转化为带评分的测试任务,然后循环执行:改写 agent 的提示词和 skills → 重训模型 → 重复。实验(4B 小模型、生物任务)显示:仅优化提示词和 skills 就把准确率从 31.1% 提到 51.1%;仅重训模型则把 4 次尝试内解题比例从 48.3% 提到 67.8%;两者结合将整体准确率从 42.2% 提升到 73.3%。

对 agent 开发者的启示:把每一条用户纠正都存为测试用例,并持续轮流升级提示词和模型。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →