VerTox 框架:针对神经排序模型的可验证语料库投毒

_reachsumit · x · 2026-09-02

Zhiqi Huang 等人提出 VerTox,这是首个将语料库投毒建模为可验证奖励引导强化学习(RLVR)问题的框架。该研究通过特定的奖励塑形,将排序失真与事实腐蚀相结合,微调小型 LLM 成为对抗性生成器。实验表明,该方法在多种神经排序架构和商业嵌入模型上实现了近乎完美的攻击成功率,生成的文档流利且困惑度低,难以检测,并能显著破坏下游 RAG 应用的性能。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →