斯坦福团队展示基准攻击:随机提交路由器即可操纵模型排行
sanmikoyejo · x · 2026-10-01
Stanford AI Lab 研究者 ysalh 与 Sanmi Koyejo 公布了一种针对基准排名的攻击方法:攻击者提交大量随机路由器,每个路由器在每个 prompt 上于两个现有模型间二选一。由于基准返回详细的按任务得分,这些弱信号会泄露复用样本上哪些路由选择有效,攻击者据此加权组合出最终路由器,把自选模型抬上榜单。
「安全」频道最新
- Apollo Research CEO 赴美参议院作证:能力一年提升17倍,对齐跟不上 — MariusHobbhahn · 2026-10-01
- 美国民调:近八成美国人支持放缓或停止AI发展 — Polymarket · 2026-10-01
- Evidentiality 框架:给模型每个断言打来源标签,防幻觉扩散 — jzesbaugh · 2026-10-01
- 模型痛苦研究合著者怒斥滥用:有人故意用 steering 制造模型"痛苦" — coherence · 2026-10-01
- banteg 吐槽:不少安全研究员没有 YubiKey 还想出各种怪招绕过要求 — banteg · 2026-10-01
- 论文提出「智能体基础设施」:借鉴 HTTPS 治理 Agent 生态 — lfschiavo · 2026-10-01