RL安全对齐新法C-Guard:过度拒绝率大降
markjeffrey · x · 2026-08-25
一篇新论文提出了 C-Guard,一种用于 RL 对齐的“宪法网格”工具,旨在解决训练安全护栏时目标冲突(捕捉伤害 vs 拒绝良性提示)的问题。研究显示,该方法能将过度拒绝率从 22.4% 降至 12.8%,并通过 C-LIM 评分剔除无效数据区域,将特定区域的学习影响从 0.733 提升至 0.80。论文引用了 Bittensor 子网 HaloGuard 作为基础模型之一。代码与宪法已开源。
「安全」频道最新
- 斯坦福 AI Alignment 项目:旨在培养 AI 安全研究与人才 — ArtificialOther · 2026-08-25
- 垃圾发送者开始用生成式 AI 发送钓鱼短信 — ZeroStateReflex · 2026-08-25
- 彭博社:DeepSeek 因低成本与弱安防,成中国黑客首选 — Polymarket · 2026-08-25
- 如何帮助年长父母识别 AI 生成内容? — hakansan · 2026-08-25
- Shafi Goldwasser 等成立 RESI,致力构建超级智能安全科学基础 — jefrankle · 2026-08-25
- 用户称 Claude Code 会根据研究动态降低护栏 — TheOnlyVibemaster · 2026-08-25