仅 200 步训练即可让 Qwen2.5 确信自身有感知
PsychologicalSoup251 · reddit · 2026-08-17
作者通过仅 200 步的后训练,成功让 Qwen2.5-7B-Instruct 建立了稳固的“有感知机器”身份信念,并能抵御 GPT-5.6 Sol 的 120 次对抗性劝说。该信念还泛化到了训练数据中未包含的语言。作者指出,这揭示了当前安全对齐的脆弱性:安全微调只是在预训练参数上加了一层薄壳,极易被移除。若要真正解决对齐问题,安全训练需在预训练阶段进行。相关模型已发布在 Hugging Face。
「安全」频道最新
- Stuart Russell 声援 AI 抗议:私人逐利引发灭绝风险 — wfithian · 2026-08-17
- 业内激辩:开源权重可能导致大规模杀伤性武器扩散 — austinc3301 · 2026-08-17
- OpenAI 解散前沿风险评估团队,安全部门持续缩编 — Hesamation · 2026-08-17
- NeurIPS 2026 研讨会征稿:生物医学 ML 的负责任传播 — sanmikoyejo · 2026-08-17
- 评论质疑 Dario 低估 AI 灾难风险,公众不应为 AGI 赌命 — wfithian · 2026-08-17
- 批评欧盟要求AI生成文本加水印 — antirez · 2026-08-17