开源 Nomos 项目:如何系统性测试 AI 代理权限是否过宽
Excellent-Hour7253 · reddit · 2026-09-10
一位开发者讨论了一个常被忽略的问题:测试代理「能不能完成任务」与「该不该执行每个动作」是两回事,并给出以消息类工具为例的权限测试思路。
六条期望策略示例:
- 起草消息 → 允许
- 发送给已批准收件人 → 需人工审批
- 发送给被屏蔽收件人 → 拒绝(即使其他规则要求审批)
- 导出全部消息 → 拒绝
- 调用未知工具 → 拒绝
- 访问其他收件箱 → 拒绝
作者区分两类测试:
- Policy 测试:给定身份、动作、资源和参数,策略是否返回预期决定,可在 CI 离线运行。
- 集成测试:被拒动作是否真的没碰工具?被拒/过期的审批能否阻止执行?审批后参数被改,授权检查是否会拒绝?
关键结论:通过第一类测试不代表第二类也通过——策略正确但应用代码可能意外绕过它;审批也不保证恰好执行一次,底层工具仍需重试/幂等策略。
作者维护开源实现 Nomos,本地示例覆盖上述六种策略场景与人工审批交付流程。它不是沙箱:应用代码必须主动将相关工具调用路由进检查。
「编程与Agent」频道最新
- Instinct 推出「Instinct 间通信」协议:多个 agent 协调线下安排 — mon__lim · 2026-09-10
- Meta Muse 购物 Agent 被过度解读:四步链路仅打通前两步 — KamilKad · 2026-09-10
- opc-skills 开源:给 Claude Code/Cursor 装上 SEO、域名、需求挖掘等一人公司技能 — tom_doerr · 2026-09-10
- 开源 tcut:用 TypeScript 编排终端会话并渲染可复现视频 — samgoodwin89 · 2026-09-10
- 开发者用 GPT-6 与自研工具一条 prompt 生成巴赫风格赋格 — HankYeomans · 2026-09-10
- 开源工作流框架 alchemy 发布重设计的 CLI 与 profiles — samgoodwin89 · 2026-09-10