研究:可从预训练中过滤掉颠覆性策略相关信息

jammastergirish · x · 2026-10-07

Geodes Research 与 Redwood Research 合作发布研究笔记,在三个 30B 参数 LLM 的预训练数据中移除与监控设计及成功颠覆策略相关的信息,证明「从预训练中过滤颠覆性内容」在技术上可行,旨在降低模型暗中破坏对齐监督的能力。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →