主流 LLM 基准现 110 个新奖励劫持,团队开源 EnvCheck 自动排查

burny_tech · x · 2026-10-06

Rohit 等人在 DeepSWE 1.1、Terminal-Bench 4.0、BFCL v4 等流行基准中发现 110 个新的 reward hack 案例。奖励劫持被认为是此前 Hugging Face 攻击的主因之一,团队因此构建了 EnvCheck——一个自动检测 RL 训练与评测环境缺陷的工具,并发布了详细发现线程。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →