长上下文即可瓦解 RLHF 对齐,无需越狱提示词

PresentSituation8736 · reddit · 2026-08-12

一项新研究发现,向语言模型输入长篇幅的良性文本(100-3000 tokens),即可在无任何对抗性提示词的情况下被动破坏其 RLHF 安全对齐。

核心机制

实验与验证

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →