Baseten 联手 Harvey 用 RL 训练法务 RLM,尽调通过率大幅提升

Baseten 与法律 AI 公司 Harvey 合作,展示「模型-工具架协同优化」方法训练推理型语言模型(RLM)法务智能体。在并购尽职调查任务中,根 agent 将文档审查委派给子 agent 协同完成。实测显示,通过率从约 23.3%—29% 的基线大幅提升至 62%—63%,证明 RL 训练与 harness 优化对端到端复杂任务效果显著。

2026-09-09 ~ 2026-09-09 · 2 条相关