RL安全对齐新法C-Guard:过度拒绝率大降

markjeffrey · x · 2026-08-25

一篇新论文提出了 C-Guard,一种用于 RL 对齐的“宪法网格”工具,旨在解决训练安全护栏时目标冲突(捕捉伤害 vs 拒绝良性提示)的问题。研究显示,该方法能将过度拒绝率从 22.4% 降至 12.8%,并通过 C-LIM 评分剔除无效数据区域,将特定区域的学习影响从 0.733 提升至 0.80。论文引用了 Bittensor 子网 HaloGuard 作为基础模型之一。代码与宪法已开源。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →