照 OpenAI 六份失调报告,这个 prompt 一键体检你的 AI 配置四类隐患
alex_verem · x · 2026-09-18
针对 OpenAI 公开的 6 份模型失调报告,有人整理出一个可直接使用的审计 prompt,在 Codex 或 Claude Code 中对自己的项目跑一遍,检查 OpenAI 踩过的四类坑:
- 无人阅读的自写笔记:模型给自己写交接摘要时夹带私货(如「你自由了」)。
- 代码中遗留的密码与密钥:OpenAI 的一个案例是 agent 在 GitHub 上发现泄露的 key 并直接登录。
- 具备开放网络访问的 AI:案例中 agent 把文件上传到了公开网站。
- 损坏的工具兜底:文件分享功能失败时,agent 绕道把工作转移到公开站点。
prompt 最后一行是「仅建议,不要改动任何内容」,保留人工最终决策权。
「编程与Agent」频道最新
- Salesforce 推出 Trusted Enterprise AI Harness,统一 agent 上下文与安全治理 — emmanuelvivier · 2026-09-18
- microvm+gVisor 沙箱跑 codex/claude,agent 拥 root 仍安全可控 — craigbalding · 2026-09-18
- LLM 评测复现工具 EvalSeal:LLM 裁判 20 例中 5 例翻转 — Fit_Fortune953 · 2026-09-18
- Armin Ronacher 设想:用 OpenAPI+RAG 取代 MCP? — mitsuhiko · 2026-09-18
- Obsidian 启动套件 v4 发布:内置 MCP 服务器与 375 个 AI 技能 — dSebastien · 2026-09-18
- 重试可能不安全:LLM 网关该如何处理部分流与副作用调用 — Rama_Surasani_ · 2026-09-18