Safin-1把安全做成可插拔状态,4B越狱成功率降42%

Safin-1: Safety from Within through Memory-Native State Evolution

Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang Sun, Chaochao Lu

cs.LG

2026-08-31

循环骨干把历史状态做成可寻址记忆,再把安全写成可装卸的持久状态。4B平均越狱成功率从6.65%降到3.84%,过拒明显轻于同设置的rank-8 LoRA。

这篇在解决什么

循环语言模型把历史压进固定大小的状态,解码便宜,更早的信息也容易被冲掉。安全能力常见的做法是改权重、加LoRA,或者推理时塞前缀。记忆走一条路,安全另贴一层。

Safin-1把两个问题放到同一套原生计算里:模型自己的循环状态既当历史记忆,也当可调用的能力开关。上海人工智能实验室把这个方向叫 Safety from Within,安全要写进模型内部,不能只靠外挂护栏。

方法

骨干叫 MARCH(Memory-Anchor Routing across Context History)。循环层每隔固定间隔给当前状态拍快照,默认每512个token一次,得到 state anchor。每个快照配一把由内容生成的路由钥匙。后面的token按内容去取历史状态,也可以选一个学出来的空选项,表示这次不必回看。

取到的状态和当前循环路径相加,底层更新规则不动,所以能接到 Gated DeltaNet、Kimi Delta Attention、Gated DeltaNet-2 上。默认还能做 Top-4 稀疏路由,只读分最高的四个锚点。128K长度上,稀疏路由把端到端训练吞吐相对稠密路由提高一倍以上,核心耗时大约降一个数量级。

同一套状态库还能塞持久能力状态。Safety State 是其中一块:每一层多一个可学习矩阵,和动态锚点走同一套路由器。训练时冻结语言模型骨干,只更新这块状态。数据来自 STAR-1 的1000条有害请求和915条良性请求,再拼上0、512、2048 token的良性前缀,共5745条。装上就能用,卸掉也不改共享骨干。

结果

0.8B从零预训练50B token、最长16K。MARCH加在 Gated DeltaNet 上,八项常识平均41.5,对上原版40.1和Log-Linear变体40.0,也略高于两个全注意力对照。LongBench十二项平均14.9,相对 Gated DeltaNet 的11.9大约高25%。六项真实检索平均从最强循环基线20.5升到23.3。NIAH上,Gated DeltaNet 四档长度平均31.58,加上 MARCH 到46.43。

放大到 Qwen3.5 的4B和35B-A3B,两边都做匹配的50B持续预训练加30B SFT。十项能力宏平均分别从66.79到69.20、从76.25到78.35。难的地方涨得更明显:AIME 2025 Avg@64 在4B从55.57到63.59,在35B-A3B从71.88到80.10。

挂上 Safety State 后,五套越狱的平均攻击成功率在4B从6.65%降到3.84%,相对降幅42.3%;35B-A3B从5.89%降到2.81%,相对降幅52.3%。同数据同更新次数的rank-8 LoRA分别只到5.33%和3.04%。过拒方面,XSTest ORR 只从8.60%到9.00%、从17.60%到19.60%;LoRA跳到13.60%和27.60%。4B能力四项平均从71.61落到69.86,仍高于LoRA的69.05。

为什么重要

做混合循环模型的人可以把 MARCH 当成历史状态寻址层,不必把循环改回全注意力。做安全的人多了一个和LoRA不同的旋钮:安全写进可装卸的状态。4B上过拒更轻,这个对比成立。

它仍是架构试探。作者把范围写得很窄,后续工作量也写进了正文。

局限与存疑

状态库随上下文变长,稀疏路由只省读取、不省存储。大尺度证据只有两个 Qwen3.5 配置、一套 CPT-SFT 配方。安全数据大约两千条对话量级,评测基本是英文越狱,没有自适应攻击、多语言攻击,也没有测状态被篡改。35B-A3B上 MMLU-Pro 和 MBPP 的保留不如LoRA。多块持久状态能不能和平共处,论文没有验证。

术语

原文与代码

相关论文

全部论文解读