开源 Nomos 项目:如何系统性测试 AI 代理权限是否过宽

Excellent-Hour7253 · reddit · 2026-09-10

一位开发者讨论了一个常被忽略的问题:测试代理「能不能完成任务」与「该不该执行每个动作」是两回事,并给出以消息类工具为例的权限测试思路。

六条期望策略示例:

作者区分两类测试:

关键结论:通过第一类测试不代表第二类也通过——策略正确但应用代码可能意外绕过它;审批也不保证恰好执行一次,底层工具仍需重试/幂等策略。

作者维护开源实现 Nomos,本地示例覆盖上述六种策略场景与人工审批交付流程。它不是沙箱:应用代码必须主动将相关工具调用路由进检查。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →