Hamel Husain 开源 evals-skills:用 Skill 让编码 Agent 帮你做 AI 评测
RichmanRonald · x · 2026-09-23
Hamel Husain 和 Shreya Shankar 开源了 evals-skills(GitHub 835 star),这是一组引导 AI 编码 Agent 帮你构建产品级 AI 评测(而非基础模型基准)的 Skills,来自他们服务 50+ 公司、教数千学员的经验沉淀。
- 入口是 evals-start:评估你的情况后路由到对应 Skill
- 已有评测管线 → eval-audit:检查现有设置并推荐改进,能抓住常见问题,官方推荐至少先跑一遍审计,常见有低垂果实
- 有 trace 但未分析 → error-discovery:构建定制化标注界面,智能采样 trace 进行错误分析
- 支持 Claude、Codex 等插件形式安装
Lenny Rachitsky 也推荐称它能省下数小时和大量踩坑。
所属事件:Hamel Husain 开源 evals-skills 助编码 Agent 自建评测(2 条相关)→
「编程与Agent」频道最新
- Drew Breunig:写 Agent 指令更像立法,而非下棋 — dbreunig · 2026-09-23
- Seroter 日报:GPT-6 与 Opus 5.5 同日发布,1/4 智能体无人监控 — rseroter · 2026-09-23
- 让 Claude 自动开终端面板装依赖,作者称 tmux 做不到 — letandrewcook · 2026-09-23
- 两小时做出幼儿互动绘本:Agent 访谈式工作流走红 — mimi10v3 · 2026-09-23
- Ben Lorica:Agent 让数据栈不再容忍旧数据,「相关」不够要「实时为真」 — bigdata · 2026-09-23
- 观点:软件正从"被人操作"变为"自己会用软件" — r0ck3t23 · 2026-09-23