开源实验:操控内部激活方向可控制 LLM 回答还是停止

rayanpal_ · reddit · 2026-09-10

作者训练开源权重模型(Qwen3-4B)做四位数比对,模型能生成正确比较结果后自主决定回答 GO 或直接结束生成,无外部过滤器参与。固定 prompt、权重与推理链,仅改变一个内部激活方向,即可完全翻转「回答/停止」行为:40/40 从回答变停止,40/40 从停止变回答,640/640 对照组不受影响。权重、代码、原始记录与论文全部公开。作者此前还记录了跨厂商的「语义虚空」行为——模型成功执行却返回零可见输出字节,覆盖 OpenAI、Anthropic、Google、Moonshot 多款模型,共 31,430 次试验。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →