LangChain 创始人评 Jev 评测法:轨迹标注应拆成多个独立问题作答
hwchase17 · x · 2026-10-09
LangChain 创始人 Harrison Chase 转发并点评了一篇关于轨迹标注(trajectory labeling)的讨论,认为其核心洞见是对的:标注不应是一次性的 pass/fail,而是若干个独立问题。
- 被引帖子指出:RL/自我改进(RSI)中轨迹标注需同时评估任务难度、解法是否正确、是否考虑过多样化设计选择、思考方向是否正确等多个维度;要对百万级 agent(各派生数十上百个子 agent)做标注,标注成本必须大幅下降
- Chase 介绍这正是 Jev 在 LangSmith evals 中的做法:难度和正确性各给出独立的类型化答案,单次遍历即可在每条 trace 上完成
- LangChain 博客详述:代码式评测快但只覆盖可完全预先指定的行为;LLM-as-a-judge 灵活但慢、贵且不确定。Jev 作为「System One」型裁判模型,为开放式 agent 行为提供快速低成本的评测并输出结构化反馈,现已在 LangSmith 的 Evaluators 标签页可用
「编程与Agent」频道最新
- Jerry Liu:定义 eval 然后爬山优化,可解几乎任何任务 — hwchase17 · 2026-10-09
- AI 日报:GPT-6.1 Sol 速度最高快 8 倍,Claude 仪表盘与动画功能开测 — testingcatalog · 2026-10-09
- 把 Anthropic 的 AI 原生 SDLC 打造成规模化软件工厂 — Pavan_Belagatti · 2026-10-09
- Satori 下版大幅扩容 CSS 支持:3D 变换、calc、min/max/clamp 全来 — shuding · 2026-10-09
- 微软老将谈 vibe coding 边界:AI 能写代码,但架构判断仍离不开人 — mjuric · 2026-10-09
- shadcn谈AI时代最重要的编码技能:别让Agent替你读 — shadcn · 2026-10-09