自动化评估到底有没有用?一组 LLM 工具在 trace 上的对比
HamelHusain · x · 2026-07-24
这条内容讨论的是 自动化评估到底靠不靠谱:作者和合作者用多个基于 LLM 的工具,在应用 trace 里识别失败案例,再拿领域专家标注作对照。
配图给出了一组系统对比,指标包括 recall、precision、发现问题数和误报数,重点呈现的是“抓得更多”和“误报更少”之间的权衡。
- Braintrust Loop:召回率 87.2%,精确率 79.1%,发现 20 个问题,9 个误报
- Arize AX Alyx:召回率 74.4%,精确率 91.0%,发现 19 个问题,3 个误报
- LangSmith (chat agent):召回率 79.5%,精确率 77.5%,发现 20 个问题,9 个误报
- Codex (GPT-5.5 High):召回率 84.6%,精确率 82.8%,发现 20 个问题,11 个误报
- Factory Droid (GPT-5.5 High):召回率 84.6%,精确率 83.3%,发现 17 个问题,10 个误报
- Claude Code (Claude Opus 4.8):召回率 79.5%,精确率 77.4%,发现 17 个问题,14 个误报
「编程与Agent」频道最新
- 开发者把 ChatGPT Voice 当 Codex 口头控制台 — Dimillian · 2026-07-24
- 作者称 UI 评测远未解决,UI Bench 仍有大量缺口 — himanshustwts · 2026-07-24
- 一文拆解 10 种 AI Agent:从反应式到多智能体系统 — goyalshaliniuk · 2026-07-24
- Favro-MCP 推出 32 工具 Go 服务器,支持 13 种 AI 客户端 — --lael-- · 2026-07-24
- Fleet 主打工程师离线时也能追踪 agents 的运转 — dee_hw · 2026-07-24
- Agentic SDLC 正把开发者从写代码推向编排 agent — Pavan_Belagatti · 2026-07-24