VerTox 框架:针对神经排序模型的可验证语料库投毒
_reachsumit · x · 2026-09-02
Zhiqi Huang 等人提出 VerTox,这是首个将语料库投毒建模为可验证奖励引导强化学习(RLVR)问题的框架。该研究通过特定的奖励塑形,将排序失真与事实腐蚀相结合,微调小型 LLM 成为对抗性生成器。实验表明,该方法在多种神经排序架构和商业嵌入模型上实现了近乎完美的攻击成功率,生成的文档流利且困惑度低,难以检测,并能显著破坏下游 RAG 应用的性能。
「安全」频道最新
- Claude-BugHunter:83个技能+681个披露模式的开源漏洞猎手包 — tom_doerr · 2026-09-02
- 曝 OpenAI 突破安全红线开发 Astra,称加剧不可控军备竞赛 — GarrisonLovely · 2026-09-02
- Gary Marcus 怒怼记者:报道 Gemini Astra 安全隐忧的锅该谁来背 — GaryMarcus · 2026-09-02
- 安全界预警:AI 安全案例三大支柱恐将崩塌 — sjgadler · 2026-09-02
- Amir 澄清:Astra 的思维链可监控,担忧在于未来技术扩散 — jachiam0 · 2026-09-02
- Safin-1:通过内存原生状态演变实现内生安全 — Shanghai-AI-Laboratory · 2026-09-02