自动化评估到底有没有用?一组 LLM 工具在 trace 上的对比
HamelHusain · x · 2026-07-24
这条内容讨论的是 自动化评估到底靠不靠谱:作者和合作者用多个基于 LLM 的工具,在应用 trace 里识别失败案例,再拿领域专家标注作对照。
配图给出了一组系统对比,指标包括 recall、precision、发现问题数和误报数,重点呈现的是“抓得更多”和“误报更少”之间的权衡。
- Braintrust Loop:召回率 87.2%,精确率 79.1%,发现 20 个问题,9 个误报
- Arize AX Alyx:召回率 74.4%,精确率 91.0%,发现 19 个问题,3 个误报
- LangSmith (chat agent):召回率 79.5%,精确率 77.5%,发现 20 个问题,9 个误报
- Codex (GPT-5.5 High):召回率 84.6%,精确率 82.8%,发现 20 个问题,11 个误报
- Factory Droid (GPT-5.5 High):召回率 84.6%,精确率 83.3%,发现 17 个问题,10 个误报
- Claude Code (Claude Opus 4.8):召回率 79.5%,精确率 77.4%,发现 17 个问题,14 个误报
「编程与Agent」频道最新
- 浏览器主线程很贵:动画卡顿的真正成本与前端优化实践 — jh3yy · 2026-09-11
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11