LangWatch 推出 Instant Evals:用 SQL 对全部生产 trace 跑评估
_rchaves_ · x · 2026-09-19
LangWatch 发布 Instant Evals 功能:可在全部生产 trace 历史上快速、低成本地运行任意评估,底层由 typesafeai 的 Jev 模型驱动,官方称其人工一致性超过前沿模型。
配套能力:
- 平台支持完整 SQL 查询 agent trace、成本分析、工具调用细节与会话聚合,eval() 可直接作为 SQL 中的函数对每条 agent 轨迹打分过滤
- 匹配结果可导出为 JSONL,用作测试集、post-training 集或蒸馏小模型的训练数据
- 典型用例:找出用户受挫的会话、发现本可省 token 的工具调用、分析 Claude Code 历史会话中让自己不爽的时刻
「编程与Agent」频道最新
- Google 等提出 Dream-RSI:用历史发现构建回放模拟器实现递归自我改进 — burny_tech · 2026-09-19
- Agent 时代编程四大转变:所有权、原语、自治与工作流 — johnlindquist · 2026-09-19
- Typesafe 发布分类模型 Jev,宣称比 LLM 快省至 200-400 倍 — hwchase17 · 2026-09-19
- Jev 被预测将革新上下文管理:按需分类替代传统 RAG — TheMoonMidas · 2026-09-19
- danluu 长文:关掉大脑用 LLM,程序员迟早被同一循环取代 — threepointone · 2026-09-19
- Parallel 发布智能体搜索能力排行榜:GPT-6 夺冠,DeepSeek 搜索提升最大 — rickasaurus · 2026-09-19