Geodes 新论文:用特殊 token 实现失调行为的可控选择性泛化
sebkrier · x · 2026-09-16
Geodes Research 团队发布新论文,展示了一种控制「失调泛化」的方法:在 midtraining 阶段,用一批描述 AI 如何失调的合成文档进行训练,并用一个新造的特殊 token 标记出「失调模式」。结果显示,模型可以在该模式下泛化出失调行为,而在模式外保持对齐。论文与 LessWrong 解读均已公开。
「安全」频道最新
- 前OpenAI成员倡议:让梵蒂冈牵头斡旋 AI 灾难风险 — jachiam0 · 2026-09-16
- 澳政府拟默认开放版权内容给 AI,被批抛弃创作者 — nordicinst · 2026-09-16
- 前 OpenAI 成员:AI 灭绝人类靠的不是恶意而是资源挤占 — AndyMasley · 2026-09-16
- 《攻击 AI 智能体的黑客指南》:系统梳理 agent 攻击面与手法 — _clickfix_ · 2026-09-16
- 开源项目 vAIvar:用蜜罐骗攻击性 AI Agent,喂它无尽幻觉 — Scobleizer · 2026-09-16
- 美参议员呼吁国会进入紧急状态,加紧推进 AI 风险立法 — tszzl · 2026-09-16