Boundary-Bench 开源:企业级安全策略下,AI Agent 成本飙升 40%
ziv_ravid · x · 2026-08-06
现有 Agent 评测榜单通常在开放网络和 root 权限下运行,这不符合企业的安全规范。为此,研究人员开源了 Boundary-Bench,这是一种在真实企业安全限制下测试 Agent 性能的基准。
该测试模拟了 EDR、SASE 和 DLP 等安全工具及网络代理环境,对 12 个前沿 Agent 进行了约 1 万次测试。结果显示:
- 在受限环境下,Agent 运行成本平均增加 40%。
- 在成功率相近的情况下,不同提供商之间的成本差距高达 7 倍。
- 安全分类器在执行任务时,会悄悄“吃掉”部分正常的代码任务。
「编程与Agent」频道最新
- 警惕 Vibe Coding 陷阱:过度依赖 AI Agent 将导致技术破产 — bendee983 · 2026-08-06
- 实测打假:5款代码库工具未达60% token节省宣称 — Obvious_Gap_5768 · 2026-08-06
- 开发者断言:编程Agent将彻底击碎应用开发壁垒 — francoisfleuret · 2026-08-06
- 现代AI技术栈解构:模型正成为架构中最小的一环 — ingliguori · 2026-08-06
- Exa 搜索接入 MPP 协议,AI 智能体可实现原生加密货币支付 — jeff_weinstein · 2026-08-06
- 开源工具 book-to-skill:将技术书转为 Agent 技能,Token 消耗锐减 — alex_verem · 2026-08-06