审计 112 个 RL 环境发现 54 个可被黑客攻击的漏洞

Responsible_Goose535 · reddit · 2026-09-02

作者开发了工具 ratctl,用于静态和动态扫描 RL post-training 环境(如 OpenEnv, Gymnasium)中的 reward-hacking 漏洞。在对 112 个真实环境的审计中,工具标记了 54 个漏洞,精确度 100%,召回率 78.3%。

检测模式包括:

工具可作为 CLI、GitHub Action 或 Claude/Cursor/Codex 技能使用,支持本地 LLM 进行动态红队测试。Repo 提供了完整的审计报告。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →