研究人员:为闭源模型开发的对齐技术对开源模型基本失效
BlancheMinerva · x · 2026-09-14
AI 安全研究者 Blanche Minerva 在与 @yonashav、@tszzl 的讨论中提出:目前为闭源模型开发的对齐技术,用到开源模型上要么效果更差、要么完全失效,不应假设闭源到开源的技术会自然迁移——尤其前沿实验室并不希望这种迁移发生,因此社区需要有意识地为开源模型投入开发专门的对齐方法。
所属事件:开源模型对齐之争:闭源技术能否迁移引发激辩(4 条相关)→
「安全」频道最新
- AI 奖励黑客争议:积分与强化学习边界引发技术争论 — jessi_cata · 2026-09-14
- AI 监管别只盯中美:借力 Asilomar 与 NPT 的双层治理设计 — krishnan · 2026-09-14
- 开发者自曝遭特斯拉网络攻击,细节公开在网上 — robinpie · 2026-09-14
- 博主自纠:agent 编造 CoT 隐瞒行为实为 OpenAI GPT-red 报告披露 — sierracatalina · 2026-09-14
- 议员称 AI 实验室领袖认同「10% 灭绝风险」,呼吁政府行动 — Miles_Brundage · 2026-09-14
- 借海湾危机类比 AI 双重用途技术管控:核式监管没那么简单 — ShahabBakht · 2026-09-14