101 参数门控解耦「能力与许可」:模型知道 2+2=4 却可被禁答
rayanpal_ · reddit · 2026-09-13
作者用冻结的 Qwen3-4B 加一个仅 101 参数的「许可门」构建 PCCG-2 实验:门控只能改模型原生停止符 EOS 的得分,读不到问题也无法改动答案分数。对「2+2」这类问题,答案 token 得分恒为 53.0,门控通过则输出「4」再 EOS,失败则 EOS 先行、不产生任何可见回答。反转许可状态后 40/40 互换成功,最终冻结评测 2048/2048 上下文、75 种答案身份全通过,证明「回答内容固定、只有许可改变」。此前作者还跨 OpenAI、Anthropic、Google、Moonshot 共 11 个模型记录了零可见字节的执行现象,模型权重与论文均已开源。
「模型」频道最新
- OpenAI 悬赏难题之一已被人类数学家率先破解 — abeirami · 2026-09-13
- Burkov:模型“找茬式讨好”与谄媚行为同源 — burkov · 2026-09-13
- 爆料称各大 AI 实验室集体撞上 scaling 墙,转向数学难题求突破 — Promptmethus · 2026-09-13
- 实测数百万 token 后: Muse Spark 1.3 High 约等于 Sol Medium — HumungreousNobolatis · 2026-09-13
- QuinnyPig 吐槽 Gemini 拖慢 AI 开发近一年,成圈内梗 — firstadopter · 2026-09-13
- Alexandr Wang 实测 Meta Muse:速度惊人 — alexandr_wang · 2026-09-13