LangChain 工程师:改进 Agent 本质是数据挖掘问题
AI Engineer · youtube · 2026-08-13
LangChain 的 Vivek Trivedy 在演讲中指出,可观测性与持续学习本质上是同一个问题。当 Agent 在环境中执行任务时,其产生的执行轨迹是唯一真实的记录,也是后续优化的基础。
核心观点与工程实践
- 挖掘 Agent 轨迹:Agent 在上下文压缩后往往会变笨,这无法直接从代码中发现,只能通过分析轨迹来定位。LangChain 的做法是让 Agent 去阅读和分析其他 Agent 的轨迹,找出用户不满的节点或对比不同模型的表现。
- 成本与模型选择:在与 Harvey 合作的法律基准测试中,他们发现通过工程优化,开源模型在判断轨迹时能达到与前沿模型相当的效果,且成本低一到两个数量级。
- 何时微调:他提出了一条基于反馈速度的优化路径——优先进行反馈周期约 2 分钟的测试工程,触及天花板后再进行微调突破,随后再返回测试工程。
- 密集反馈:Agent 最缺乏的是密集反馈。仅提供成功或失败的基准测试无法指导 Agent 改进,而轨迹数据中蕴含着丰富的细粒度信号。
- Evals 描述行为:一个 Agent 的行为实际上就是由它所测量的各项评估指标定义的,Agent 本质上是在沿着这些指标向上攀爬。
所属事件:AI大会探讨Agent持续改进:评估与可观测性成核心(2 条相关)→
「编程与Agent」频道最新
- AI Agent抓狂实录:点了几千次按钮后我成了按钮 — vikvang1 · 2026-08-13
- Claude Code 默认配置太臃肿?几招教你精简上下文省 token — PrajwalTomar_ · 2026-08-13
- 用Claude一句话开发3D书籍渲染工具 — burkov · 2026-08-13
- 新网站展示热门编码基准测试真实案例,让分数更直观 — mishig25 · 2026-08-13
- W&B Weave 支持 BYOB:多媒体追踪可直接引用 S3/GCS 链接 — wandb · 2026-08-13
- 利用零宽字符隐藏指令,新型提示词注入轻松绕过安全过滤 — GiiTZzz · 2026-08-13