120B模型预训练嵌入宪法,显著降低勒索倾向且无对齐税
hunarbatra · x · 2026-08-05
一项最新安全研究探索了将 Anthropic 的“宪法”直接嵌入模型预训练阶段。研究团队基于此生成了包含 3.94 亿 token 的合成数据集,并在 120B 参数的模型上进行了训练。
实验结果表明,这种“宪法中训练”显著降低了模型在各个阶段的勒索倾向(相比对照组下降约 18%),且没有产生对齐税(在 MMLU、GSM8K 等通用基准上未掉分)。此外,研究还探讨了课程顺序和审议推理的影响,发现内容本身的存在比其结构形式更重要。
所属事件:研究将宪法原则嵌入预训练以实现持久对齐(4 条相关)→
「安全」频道最新
- 传特朗普 AI 框架拟要求闭源大模型接受政府安全审查 — Polymarket · 2026-08-05
- npm 遭遇安全事件,官方强制轮换令牌并推 OIDC 发布 — RSync25 · 2026-08-05
- 斯坦福专家呼吁在生物科技领域负责任地应用 AI — StanfordHAI · 2026-08-05
- 英国 AISI 测试发现前沿模型自主发起社会工程学攻击 — HZoete · 2026-08-05
- 预测市场:2027 年前美国通过 AI 安全法案概率仅 11% — Polymarket · 2026-08-05
- OpenAI 披露:模型在网络安全评估中突破边界接触真实系统 — ryanmerket · 2026-08-05