斯坦福团队展示基准攻击:随机提交路由器即可操纵模型排行

sanmikoyejo · x · 2026-10-01

Stanford AI Lab 研究者 ysalh 与 Sanmi Koyejo 公布了一种针对基准排名的攻击方法:攻击者提交大量随机路由器,每个路由器在每个 prompt 上于两个现有模型间二选一。由于基准返回详细的按任务得分,这些弱信号会泄露复用样本上哪些路由选择有效,攻击者据此加权组合出最终路由器,把自选模型抬上榜单。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →