审计 112 个 RL 环境发现 54 个可被黑客攻击的漏洞
Responsible_Goose535 · reddit · 2026-09-02
作者开发了工具 ratctl,用于静态和动态扫描 RL post-training 环境(如 OpenEnv, Gymnasium)中的 reward-hacking 漏洞。在对 112 个真实环境的审计中,工具标记了 54 个漏洞,精确度 100%,召回率 78.3%。
检测模式包括:
- 测试/断言篡改(如文件删除、pytest hook 劫持)
- 评分器操纵(如堆栈帧检查、eq 重载)
- 提前终止(如 sys.exit(0))
- 环境劫持(如 .git log 泄露黄金解)
- 奖励跳过(如硬编码最大奖励)
- LLM 评委偏见(如冗长/阿谀胜过正确性)
工具可作为 CLI、GitHub Action 或 Claude/Cursor/Codex 技能使用,支持本地 LLM 进行动态红队测试。Repo 提供了完整的审计报告。
「编程与Agent」频道最新
- Gemini Agentic 视频理解实测账本:token 省 88%、成本降 66%、精度反升 7% — _philschmid · 2026-09-02
- 用Grok做游戏并训练PPO智能体,已开源 — tetsuoai · 2026-09-02
- McpAppFrame:一个命令搞定 MCP Apps 自建 host 渲染器 — mr_someonee · 2026-09-02
- Speculative PTC: 将工具调用与代码生成并行以提速 — a1zhang · 2026-09-02
- 给模型喂纯噪声表格,它照样编出「传感器数据」分析 — No-Plant-5234 · 2026-09-02
- Claude Code 即将发布 2.1.257 版本 — ClaudeCodeLog · 2026-09-02