Claude Code 推出 plugin eval,Hamel Husain 四点点评直指改进空间
sh_reya · x · 2026-09-12
Anthropic 的 ClaudeDevs 团队为 Claude Code 推出新功能 claude plugin eval:可创建测试用例、用这些用例运行插件或 skill、为运行结果打分,并可在无插件条件下重跑用例对比差异,衡量插件的实际价值。
Hamel Husain 试后给出改进建议:
- 就地反馈:目前是先让你凭记忆回答插件使用经验的问答式流程,更好的做法是边用边反馈
- 先做错误发现:现在直接根据前置回答和文档自动构建数据集与评判,应该先和用户一起做 error discovery、标注真实 trace/会话历史,弄清哪里不工作
- 兼容性:对非插件形式的 skill 配置 eval 很笨拙,得让 Claude 帮忙搭,花了 10 分钟
- 报告可读性:生成的 HTML 报告需要盯着看很久才能理解各部分含义
所属事件:Claude Code 推出 plugin eval 量化插件价值(10 条相关)→
「编程与Agent」频道最新
- 用 Fable 和 Astra 得「token 焦虑」:怕 agent 跑偏烧光额度全程盯着 — johnlindquist · 2026-09-12
- DSPy 3.4 候选版发布:弃用 litellm,导入更快依赖更轻 — lateinteraction · 2026-09-12
- GPT-6 Astra 实测:做游戏与 3D 神奇,离日常主力还差两口气 — petergyang · 2026-09-12
- OpenEval 作者:看 trace 找 agent 作弊,别只看 UI — zeeg · 2026-09-12
- AI 消解迁移顾虑,开发者对 TypeScript Effect 库态度逆转 — ethanniser · 2026-09-12
- Git AI 开源团队二人组加入 OpenAI,助力 Codex 企业落地 — yenkel · 2026-09-12