研究:可从预训练中过滤掉颠覆性策略相关信息
jammastergirish · x · 2026-10-07
Geodes Research 与 Redwood Research 合作发布研究笔记,在三个 30B 参数 LLM 的预训练数据中移除与监控设计及成功颠覆策略相关的信息,证明「从预训练中过滤颠覆性内容」在技术上可行,旨在降低模型暗中破坏对齐监督的能力。
「安全」频道最新
- 有人用僵尸网络批量抢注.si域名,斯洛文尼亚域名服务遭滥用 — BLUECOW009 · 2026-10-07
- 研究者批 AI 政策圈误判:超级智能也无法自动修复所有代码漏洞 — joshua_saxe · 2026-10-07
- 两周人工渗透被压缩到 10 小时,AI 正在改写攻击经济学 — bigdata · 2026-10-07
- 澳洲隐私机构调查 HeyCyan 眼镜:中国 App 厂商拒不回应 — nordicinst · 2026-10-07
- 法院采信AI生成的死者原谅视频,杀人犯获重新量刑引伦理争议 — GlenBradley · 2026-10-07
- 对齐研究陷入「猫鼠游戏」:评测套利让安全策略疲于奔命 — JacquesThibs · 2026-10-07