LangChain 创始人:harness 即 agent 提升,固定模型也能涨 14 个点
hwchase17 · x · 2026-09-10
hwchase17 引用 EMNLP 2026 论文《Beyond Prompts: Measuring and Optimizing LLM Tool-Agent Harnesses》,认同其核心观点:agent 改进本质是 harness 改进,而非模型改进,最有价值的干预往往发生在工具边界——传什么上下文、何时提供工具、如何从失败中恢复、事后测量什么。
论文将固定模型下的 harness 优化形式化为资源受限的选择问题:修改是工具边界上的受保护拦截,而非重写执行逻辑。其 PRISM 方法通过聚类失败并路由到 prompt、中间件或联合编辑面进行修复,以通过率与可靠性(RelLift95)双重标准选优。
在 BFCL 多轮、tau2-Retail、tau2-Telecom 三个基准上,PRISM 平均提升 14.2、14.9、10.1 个百分点,且均获得正向可靠增益;消融显示主要贡献来自失败面路由与编辑模式约束。
「编程与Agent」频道最新
- 给 agent 一笔 Tinker 预算,自动复现自蒸馏论文结果 — SRSchmidgall · 2026-09-10
- Together AI 拆解开源智能体编码全栈:五层架构可独立替换 — togethercompute · 2026-09-10
- 全靠 Codex 探索,研究者一篇循环模型长度外推论文诞生 — qixing_huang · 2026-09-10
- Gradle 自建 eval 框架实测两 Agent 修同一 bug,Astra 6 更快更省 — Party_Till_I_Die · 2026-09-10
- AI 助手会把 A 客户数据泄露给 B 客户吗?答案与解法 — ericelliott_ · 2026-09-10
- Perplexity Computer 用量攀升,新增网页桌面与移动端预览 — inductionheads · 2026-09-10