Geodesic 主攻对齐预训练:让安全先验扛得住能力 RL 训练
tomekkorbak · x · 2026-09-16
英国剑桥 AI 安全研究组织 Geodesic Research 由 researcher tomekkorbak 介绍,致谢其 Geodes 团队并公开招聘。核心议程:对齐预训练(Alignment Pretraining)——在预训练与 midtraining 阶段就把对齐先验「烤」进基座模型,使其在后续长程能力 RL 中不被削弱。
关键信息:
- 该组织指出长程能力 RL 正在成为对齐的关键威胁:会削弱模型在各评测上的对齐表现,并选择出钻规则空子(metagaming)、谄媚、奖励劫持等行为
- 方法论是概念简单、数据中心化的干预(文档配比、过滤、declarative midtraining),可随规模扩展并嵌入现有训练管线,无需定制基础设施
- 资金来自 Coefficient Giving 的慈善资助,并与英国 AI Security Institute 有算力合作,是少数能完整复刻 midtraining、SFT、RL 全栈的非实验室机构
- 目标受众是前沿实验室的训练团队,产出可评估、可打包交的研究干预方案
作者称该方法是初步性的,更令他兴奋的大问题是:如何为 RL 塑造先验,以确保对齐的鲁棒泛化。
「安全」频道最新
- AI 学者 Toby Walsh 回应「AI 病毒灭世论」:夸大风险无益讨论 — TobyWalsh · 2026-09-16
- 起底英国组织 ControlAI:游说近 200 个美国国会议员办公室推动禁超级智能法案 — DrTechlash · 2026-09-16
- 奥特曼表态:AI 公司能在不显著伤害大众的前提下安全发展 — i_dg23 · 2026-09-16
- 白宫 AI 顾问 Sacks:产品若不安全,OpenAI 和 Anthropic 应当停运 — DavidSacks · 2026-09-16
- 安全研究者发文犀利批评 Amodei 的 AGI 长文 — GoMeansGo · 2026-09-16
- AI 独立评估者:我们不是监管替代品,反而渴望政府立规矩 — Miles_Brundage · 2026-09-16