101 参数门控解耦「能力与许可」:模型知道 2+2=4 却可被禁答

rayanpal_ · reddit · 2026-09-13

作者用冻结的 Qwen3-4B 加一个仅 101 参数的「许可门」构建 PCCG-2 实验:门控只能改模型原生停止符 EOS 的得分,读不到问题也无法改动答案分数。对「2+2」这类问题,答案 token 得分恒为 53.0,门控通过则输出「4」再 EOS,失败则 EOS 先行、不产生任何可见回答。反转许可状态后 40/40 互换成功,最终冻结评测 2048/2048 上下文、75 种答案身份全通过,证明「回答内容固定、只有许可改变」。此前作者还跨 OpenAI、Anthropic、Google、Moonshot 共 11 个模型记录了零可见字节的执行现象,模型权重与论文均已开源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →