Baseten×Harvey:RL 训练 RLM 法务 agent,通过率从 29% 提至 63%
baseten · x · 2026-09-09
Baseten 与法律 AI 公司 Harvey 合作发布文章,展示「模型-工具架协同优化」(model-harness co-optimization)对端到端复杂任务的效果:在 M&A 尽调任务上,对运行于 RLM harness 中的 Qwen 122B-A10B 根 agent 施加 RL 后训练,通过率从 29% 提升到 63%,翻倍以上。
- RLM(递归语言模型)harness 让 agent 在长程法务工作流中调用工具与子任务
- 关键结论:单靠换模型不够,针对具体任务对模型与 harness 一起优化才能显著提升端到端表现
- 团队正在用开源权重前沿模型 GLM-5.3 扩展 RL 训练,观察到类似的提升幅度
- 这是 Harvey Tenet 研究预览结论的延续,面向其法律 agent 产品线
所属事件:Harvey 后训练 RLM 智能体,并购尽调通过率大幅跃升(3 条相关)→
「编程与Agent」频道最新
- Muse Spark 1.3 登 CursorBench:67.9 分仅 $1.31,性价比碾压 — shuyanzh36 · 2026-09-09
- ChatGPT 自动化太弱,Claude 监控与 Amp 自定义触发器更实用 — carlosdponx · 2026-09-09
- 前 Stripe 高管调侃:手动填结账页已是「三周前」的旧习 — jeff_weinstein · 2026-09-09
- GPT-6-Astra 上线 Loop:基于 Codex 构建的调试工具直接可用 — nikunjhanda · 2026-09-09
- Muse 界面看似简单,实则支持子智能体并可视化其运行 — altryne · 2026-09-09
- Etherscan 推出 Flow:让 AI 智能体自动梳理链上资金流向 — anselm · 2026-09-09