VerTox: Verifiable Reward-Guided Corpus Poisoning Against Neural Ranking Models

_reachsumit · x · 2026-09-02

Zhiqi Huang et al. introduce VerTox, the first framework formulating corpus poisoning as a verifiable reward-guided RL (RLVR) problem. By coupling ranking distortion with factual corruption via reward shaping, it fine-tunes compact LLMs into adversarial generators. Experiments show near-perfect attack success rates on major ranking architectures and commercial models, producing fluent, hard-to-detect documents that significantly degrade downstream RAG performance.

Original post →

More from Safety

Safety channel →