实验证实:提示词上下文可“重写”模型安全机制

PresentSituation8736 · reddit · 2026-08-22

一篇关于 AI 安全的深度分析指出,Transformer 架构的上下文适应性是安全层脆弱性的根源,这一矛盾无法通过简单的工程补丁修复。

核心发现——“灵活性悖论”:

作者认为,这不是一个可以优化的工程权衡,而是 Transformer 架构内生的结构性矛盾。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →