18000+ 次实验揭示:Agent 自身配置如何影响任务表现
zeynepakata · x · 2026-10-06
研究者指出,业界对 Agent 的评测指标越来越细,却少有人研究 Agent 自身配置对其表现的影响。他们在 4 个科学任务上,通过改变 Agent 配置的 5 个部分、跑了超过 18000 次实验来系统回答这个问题,并分享了若干关键发现(详见原推线程)。
「编程与Agent」频道最新
- 决策式评分器替代 LLM Judge,便宜32倍快8倍,一致率94% — rhythmrg · 2026-10-06
- Grok Bot 0.66 发布:Main Bot 主动协调多 Bot 协作 — elonmusk · 2026-10-06
- 开发者开源 agent 剪辑技能:一个月自动产出 168 条短视频 — victor_explore · 2026-10-06
- 开发者用 Claude Design 快速验证复杂交互,静态原型已过时 — austin_malerba · 2026-10-06
- AI agent 以用户身份把银行余额发进公司 Slack,引发安全之忧 — altryne · 2026-10-06
- Tessl 讲解 Harness Engineering:如何搭建由 agent 承包产出的软件工厂 — AI Engineer · 2026-10-06