SkillRoll:用“地下城主”模拟世界测试 Agent Skills
Pretend_Conflict8159 · reddit · 2026-08-26
Agent Skills 难以测试,因为有趣行为往往依赖提示词之外的文件、工具或网站状态。作者开源了 SkillRoll,一个通过模拟世界来评估 Skills 的工具。
核心机制:
- Input: 给 Skill 的任务。
- World: 私有的环境描述及 Skill 行动后的反馈逻辑。
- Success Criteria: 可观察的成功行为标准。
测试时,一个“地下城主”Agent 负责根据 World 描述响应 Skill 的工具调用,最后由 LLM-as-a-judge 判定是否达标。
使用体验:
- 编写 Eval 只需一个 Markdown 文件。
- 安装后 skillroll init 即可开始,skillroll eval 运行并生成报告。
- 作者测试了 openai/gpt-5.6-luna-pro,单次 Eval 成本低于 $0.01。
该项目为 MIT 协议,无付费版或遥测,适合作为 CI/回归测试工具。
「编程与Agent」频道最新
- Agent 沙盒工具的意外用法:Receipt 成刚需 — Common_Dream9420 · 2026-08-26
- MCP 解决了访问,A2A 解决了数据经济问题 — jpolec72 · 2026-08-26
- 实测 Agent 编排:并非 PPT 概念,百行代码即可落地 — Positive-Ad3618 · 2026-08-26
- 求助:求推荐实用的个人 AI Agent 框架,要求低代码且可本地运行 — Infamous-Gain-6786 · 2026-08-26
- LLM 评测陷阱:不要盲目信任作为裁判的模型 — maylad31 · 2026-08-26
- Qwen-Code v0.22.2 发布:工具路径提速 91% — qwen-code-ci-bot · 2026-08-26