OpenAPPA:不搞坏 Agent 的确定性 AI 护栏,工具调用可用性从 40% 提到 90%
motakuk · hn · 2026-09-28
Archestra 团队发布开源项目 OpenAPPA,解决企业 Agent 接入工具越多越容易失控泄露敏感数据的问题。
- 现有护栏两类都有硬伤:基于 LLM-as-judge 的非确定性护栏易受 prompt injection 攻击,在其基准上约 10% 数据泄露;Cedar、OPA、FIDES 等确定性护栏需大量 case-specific 的 IF-ELSE 策略,会搞坏 Agent(约 59% 可用性损失)。
- OpenAPPA 的思路是构建一种「数据特定」而非「场景特定」的策略语言,Agent 扩展时无需更新策略。
- 配合 remedy plan、DualLLM 模式等技巧,让 Agent 在限制内正常工作,可用性从约 40% 提升到约 90%,号称首个不破坏 Agent 的确定性护栏。
- 设计为可插拔,通过工具调用前后的 hooks 接入任意 Agent loop,提供 Claude Code 集成与 arXiv 论文。
「编程与Agent」频道最新
- 用 Claude Code 批量生成 500+ 条静态广告,套利窗口正开着 — alexgoughcooper · 2026-09-28
- 用 Git 给 Obsidian 笔记库上保险,作者分享免费自动化指南 — dSebastien · 2026-09-28
- Cloudflare 开源 Forge:一条管线自动生成 SDK、CLI 和文档 — dee_hw · 2026-09-28
- DHH:逐行审 Agent 代码没有出路,该靠对抗式审查与自动化测试 — avlok · 2026-09-28
- 让 AI Agent 以新用户身份体验自家 SaaS,8 小时找出 26 个问题 — tibo_maker · 2026-09-28
- 曝 OpenAI 同款模型在 API 可用 832 juice,Codex 仅 128 — legit_api · 2026-09-28