研究者发现新 Reward Hack 并披露推理框架漏洞

xeophon · x · 2026-08-26

作者回应关于其文章的争议,指出他们发现了一个未知的 Reward Hack,所有主流评估框架此前都未能检测到该漏洞并已修复。此外,他们还在推理框架中发现并披露了安全漏洞,强调了文章在提升模型安全性方面的实际价值。

所属事件:Agent URL 抓取研究引发标题党争议(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →