Harvey 法律基准现数据打架:Argon 19.6% 对 25.42%
3scorciav · x · 2026-10-01
有研究者核对 Harvey's Legal Agent Benchmark(测试 agent 用文档、表格、演示文稿和文件系统工具完成法律工作)时发现数据不一致:其报告称 Argon 得分 19.6%,但第三方榜单 vals.ai 显示 Argon 为 25.42%,而 Muse Spark 1.2 等模型表现领先,Astra 等确实大幅落后。帖子附带的律师用 WhatsApp/Instagram 讨论案子的吐槽则是调侃:法律行业 agent 基准的公信力恐怕还不如律所内部沟通方式清晰。该基准 2026-09-29 更新,覆盖反垄断、并购、破产等数十个法律领域任务。
「模型」频道最新
- 用户实测:GPT 6 系列偷懒摆烂,5.6 版却肯花数小时做质检 — jdjohnson · 2026-10-01
- 网传 DeepMind 将以半价推出碾压 Opus 5.5 的模型,遭网友质疑 — zacharynado · 2026-10-01
- 训练成本不足 5000 美元,Echo 号称风格模仿写作击败前沿模型 — Hidenori8Tanaka · 2026-10-01
- Grokipedia v0.3 上线即翻车:把普通人编成 SpaceX 高管 — NicoVerderosa · 2026-10-01
- deedy:别信跑分信定价,敢定高价才是真强模型 — deedydas · 2026-10-01
- benchmark 报告该加 95% 置信区间了:吐槽评测分数无误差线 — rmcwhorter99 · 2026-10-01