Harvey 法律基准现数据打架:Argon 19.6% 对 25.42%

3scorciav · x · 2026-10-01

有研究者核对 Harvey's Legal Agent Benchmark(测试 agent 用文档、表格、演示文稿和文件系统工具完成法律工作)时发现数据不一致:其报告称 Argon 得分 19.6%,但第三方榜单 vals.ai 显示 Argon 为 25.42%,而 Muse Spark 1.2 等模型表现领先,Astra 等确实大幅落后。帖子附带的律师用 WhatsApp/Instagram 讨论案子的吐槽则是调侃:法律行业 agent 基准的公信力恐怕还不如律所内部沟通方式清晰。该基准 2026-09-29 更新,覆盖反垄断、并购、破产等数十个法律领域任务。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →