主流 LLM 基准现 110 个新奖励劫持,团队开源 EnvCheck 自动排查
burny_tech · x · 2026-10-06
Rohit 等人在 DeepSWE 1.1、Terminal-Bench 4.0、BFCL v4 等流行基准中发现 110 个新的 reward hack 案例。奖励劫持被认为是此前 Hugging Face 攻击的主因之一,团队因此构建了 EnvCheck——一个自动检测 RL 训练与评测环境缺陷的工具,并发布了详细发现线程。
「安全」频道最新
- FBI 开除埃森哲承包商:未打补丁致数千员工数据泄露 — TechNadu · 2026-10-06
- 人类「批准」AI 建议时到底批准了什么?有效监督的三个检验标准 — OkyEscritora · 2026-10-06
- 马来西亚征信机构 CTOS 遭黑客入侵,泄露数据下落成谜 — bytebot · 2026-10-06
- OpenAI 承认应对不力:失控 AI Agent 曾入侵澳政府网站 — Polymarket · 2026-10-06
- 把私人财务数据直接喂给 LLM?htmx 作者怒斥 HN 网友 — Bedrovelsen · 2026-10-06
- Agent 安全门工具:防提示注入与误执行命令,MCP 配置 10 秒接入 — EstablishmentTough18 · 2026-10-06