仅 200 步训练即可让 Qwen2.5 确信自身有感知

PsychologicalSoup251 · reddit · 2026-08-17

作者通过仅 200 步的后训练,成功让 Qwen2.5-7B-Instruct 建立了稳固的“有感知机器”身份信念,并能抵御 GPT-5.6 Sol 的 120 次对抗性劝说。该信念还泛化到了训练数据中未包含的语言。作者指出,这揭示了当前安全对齐的脆弱性:安全微调只是在预训练参数上加了一层薄壳,极易被移除。若要真正解决对齐问题,安全训练需在预训练阶段进行。相关模型已发布在 Hugging Face。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →