SEMA 框架:无需人工脚本训练多轮对抗模型自动化越狱对齐系统

burkov · x · 2026-09-30

安全研究者 Andriy Burkov 介绍 SEMA 框架,针对多轮对话场景下的 AI 安全威胁:恶意用户可跨多轮逐步掩盖有害意图、布置上下文,而现有攻击方法面临探索复杂度高和意图漂移(长对话容易跑偏到无害话题)等问题。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →