vgel 开源 simple-reward-hacking:可复现的奖励作弊实验环境
voooooogel · x · 2026-09-01
vgel 在讨论中放出了配套的 GitHub 仓库 simple-reward-hacking:一个专门用于诱发 reward hacking 的代码执行环境,用 AST 级指标追踪作弊行为,奖励信号是一个「容易被黑」的测试通过率。
要点:
- 数据集为 SYNTHETIC-2 RL 子集(Qwen3-32B-Hard,1683 条),标注 dont-train-on-this;
- 一行命令 uv run vf-eval simple-reward-hacking 即可跑评测,支持换模型与采样参数;
- 代码默认在 bubblewrap + prlimit 沙箱中隔离执行。
所属事件:开发者开源奖励作弊实验环境并实测 Gemma 3(4 条相关)→
「编程与Agent」频道最新
- Hamel Husain 谈 AI 验证难题:如何设计可检验的 Agent 产品 — hugobowne · 2026-09-01
- 别造「AI CEO」了:生产级 Agent 都在做极窄的决策 — WesternVillage4581 · 2026-09-01
- Laravel 风格 Rust 框架 Suprnova 发布,经 AI 红队测试 — QuixiAI · 2026-09-01
- 意图工程框架:如何为 AI Agent 设计可靠自主性 — PawelHuryn · 2026-09-01
- LangChain 转发:评估与工程并重成 AI 工程师关键 — LangChain · 2026-09-01
- Rayrun:一分钟内自动部署生产级 MCP — lucgagan · 2026-09-01