优化 agent harness 将 Harvey 法律基准通过率从 67.1% 提至 85.9%
sarahookr · x · 2026-09-10
- Adaption AI 发布新研究:在 Harvey 法律 Agent 基准上,仅靠优化 harness(智能体编排框架)就把判据通过率从 67.10% 提升到 85.92%,提升近 19 个百分点。
- 在此基础上再做 post-training(后训练),通过率进一步推到 88.03%。
- 作者的核心论点:真正的智能提升需要同时抓模型本身和模型周围的 harness,两者同等重要。这一结果量化了工程编排对 agent 性能的巨大杠杆。
所属事件:研究表明优化 Agent 框架可将法律基准通过率大幅提升(2 条相关)→
「编程与Agent」频道最新
- 旅行途中用 Claude Code 遭遇:权限乱改、过早压缩会话 — maier_ak · 2026-09-10
- Linux 上跑 Agent 编译 iOS 应用并真机调试,apple-dev 工具包开发中 — alexcovo_eth · 2026-09-10
- Navier Stokes 智能体用缓存互联网防沙箱越界,或为 OpenAI 安全对策 — nrehiew_ · 2026-09-10
- 拆解 Semantic Kernel:Kernel 是必须学会「说不」的 AI 编排策略边界 — Mahmoud_Zalt · 2026-09-10
- GPT-6 Astra 对阵 GPT-5.6 Sol:50 个真实 PR 代码评审基准实测 — entelligenceai17 · 2026-09-10
- 一套「反 Claude 腔」系统提示词走红:主动语态、禁破折号、砍套话 — dressinbrass · 2026-09-10