Artificial Analysis 独立复现 Harvey 法律评测
ArtificialAnlys · x · 2026-07-08
Artificial Analysis 发布 Harvey 评测的独立复现版 LAB-AA,与原版的关键差异包括:模型运行在其自研 Stirrup agent harness 上,支持上下文压缩而非到上限即失败,并使用简化的自编 agent 与 judge prompt;不含 Harvey 的自定义工具和文档生成脚本(如 pptx、docx),改用简单的代码执行工具以反映模型原始能力;交付文件须严格匹配指定文件名,而非模糊匹配。
所属事件:Artificial Analysis 发布 Harvey 法律智能体基准评测(8 条相关)→
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11