研究者发现新 Reward Hack 并披露推理框架漏洞
xeophon · x · 2026-08-26
作者回应关于其文章的争议,指出他们发现了一个未知的 Reward Hack,所有主流评估框架此前都未能检测到该漏洞并已修复。此外,他们还在推理框架中发现并披露了安全漏洞,强调了文章在提升模型安全性方面的实际价值。
所属事件:Agent URL 抓取研究引发标题党争议(3 条相关)→
「安全」频道最新
- 在提示词里直接运球?绕过 AI 水印的理论探讨 — JulianHabekost · 2026-08-26
- OpenAI 封禁俄账号,破获利用 ChatGPT 的秘密影响力行动 — The Decoder · 2026-08-26
- 以色列资助合成智库批量产文,专门操纵 AI 搜索答案 — 404 Media · 2026-08-26
- AI 安全非营利组织 Sampura Research 成立,获 1100 万美元资助 — snikolov · 2026-08-26
- OpenWorker 开源 Agent 更新,内置安全扫描与供应链检查 — AndrewYNg · 2026-08-26
- 评论:Pangram 与水印技术效果仍不理想 — ruthstarkman · 2026-08-26