新评测技能可用仓库上下文和轨迹自动生成 agent 测试
willccbb · x · 2026-07-23
帖子发布了一个面向 coding agents 的 Eval Engineering Skill,目标是帮助智能体根据仓库上下文和 agent traces 自动构建评测。
- 这个 skill 会先分析 agent 的结构。
- 再从仓库和运行轨迹里挖出相关上下文。
- 核心价值在于把“给 agent 做评测”这件最麻烦的工程工作尽量自动化。
所属事件:LangChain 推出 Eval Engineering 助力编程智能体自建评估(6 条相关)→
「编程与Agent」频道最新
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11