Baseten×Harvey:RL 训练 RLM 法务 agent,通过率从 29% 提至 63%

baseten · x · 2026-09-09

Baseten 与法律 AI 公司 Harvey 合作发布文章,展示「模型-工具架协同优化」(model-harness co-optimization)对端到端复杂任务的效果:在 M&A 尽调任务上,对运行于 RLM harness 中的 Qwen 122B-A10B 根 agent 施加 RL 后训练,通过率从 29% 提升到 63%,翻倍以上。

所属事件:Harvey 后训练 RLM 智能体,并购尽调通过率大幅跃升(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →