开源实验:操控内部激活方向可控制 LLM 回答还是停止
rayanpal_ · reddit · 2026-09-10
作者训练开源权重模型(Qwen3-4B)做四位数比对,模型能生成正确比较结果后自主决定回答 GO 或直接结束生成,无外部过滤器参与。固定 prompt、权重与推理链,仅改变一个内部激活方向,即可完全翻转「回答/停止」行为:40/40 从回答变停止,40/40 从停止变回答,640/640 对照组不受影响。权重、代码、原始记录与论文全部公开。作者此前还记录了跨厂商的「语义虚空」行为——模型成功执行却返回零可见输出字节,覆盖 OpenAI、Anthropic、Google、Moonshot 多款模型,共 31,430 次试验。
「研究」频道最新
- 幻觉率成淘汰门槛:8 款模型实测揭示 LLM 换型评测的统计陷阱 — dl_weekly · 2026-09-10
- Joseph Suarez 推出强化学习系列节目 — jsuarez · 2026-09-10
- SimWorld 将推 Code4Scene 基准:一句提示生成可探索集装箱港口 — Lianhuiq · 2026-09-10
- Salesforce 发布 EvoHarnessBench:考验 Agent 应对工具与环境持续演进 — Salesforce · 2026-09-10
- 40 分钟用 AI 搭出 Rentosetib 机制演示,抗衰老药临床见成效 — DeryaTR_ · 2026-09-10
- AlphaFold 帮 Cornell 团队发现可关闭癌细胞运动的隐藏「开关」 — Dr_Singularity · 2026-09-10