新论文:用均值差向量从模型内部表征提前发现 reward hacking
burny_tech · x · 2026-09-21
arXiv 新论文《Monitoring and Discovering Reward Hacking with Internal Representations during LLM Evaluations》提出:仅用简单的 difference-of-means 向量,就能从 LLM 内部表征中低成本检测 reward hacking,并在作弊行为发生前进行预测。
「安全」频道最新
- IIT 马德拉斯学者:印度需建立独立 AI 测量能力应对智能体风险 — ravi_iitm · 2026-09-21
- 把税务文件凭证交给 AI 助手:好用但令人不安 — zeeg · 2026-09-21
- Roblox CEO 建议美国立法禁止向中国 AI 公司支付许可费 — robleclerc · 2026-09-21
- 反偷拍应用 ZuckOff 走红:靠蓝牙指纹识别身边 Meta 智能眼镜 — LexiLove · 2026-09-21
- DeepSeek 网页版文风被指遭安全对齐「脑叶切除」 — Old_Let6328 · 2026-09-21
- MacBook 内置 IMU 沦为侧信道:击键还原准确率最高 97.5% — chaumian · 2026-09-21