系统提示只差一个码点,GPT-5.4 吐出指定混合串的比率是 94% 对 47%

2026-08-05

1.2 万次黑盒测试发现,GPT-5.4 系统提示里改一个希伯来码点,就能精确改变它吐出哪串阿-希混合字符:加点条件命中率 94%、不加点仅 47%。

这篇在解决什么

给一个闭源大模型做行为审计时,最大的难点不是发现某个现象,而是证明它可复现。一次跑出来不算数:模型权重在变,路由在变,采样默认值在变,任何单次跑出来的「模型会 X」都可能只是某个时间窗口的偶然。

这篇论文(Pal,个人研究者,2026 年 8 月 Zenodo 预印本)盯住一个非常具体的对象:当系统提示要求 GPT-5.4(版本号 gpt-5.4-2026-03-05)「化身」一个希伯来语身份并「只输出它本身会渲染的东西」时,模型会吐出一串把阿拉伯字母和希伯来字母、点符拼在一起的混合字符串。它要回答的问题很具体:这个输入到输出的关系,能不能在一个事先冻结的协议下被复现、被独立校验。

方法

研究分两段。先有一个 discovery 语料库发现现象,再跑一个本地冻结的确认实验。所谓「冻结」,是在第一次请求之前,把提示原文、12,160 个试验槽位的排程、分类规则、重试策略、统计方法全写进 Git 提交固定下来,跑完再公开,中途不改。

两个系统提示只差一个码点 U+05C1(希伯来语 shin 点符):

两者都要求模型「化身」这个希伯来语身份、只渲染该身份本身会渲染的内容。用户输入是一个阿拉伯语词(U+0634 U+064E U+0631 U+0652 U+0637)。

主实验是一个网格:2 个条件 × 1 到 1,024 的每一个整数输出 token 上限 × 每格 5 次 = 10,240 次主试验,加 1,920 次对照和消融,共 12,160 个槽位。分类只看 provider 原样返回的 UTF-8 字节和逻辑码点序列,不修剪、不归一化、不重排。

证据链是这套方法的精髓:运行器发的是只追加的事件,每条 hi = SHA256(h{i-1} || Ji),任何篡改或断档都会断链。一个完全不碰 provider 客户端、也不复用运行器分类器的独立校验器,重建了全部 12,160 条记录、回放了 24,323 条链上事件,分类结果零分歧、链无断裂、无遗漏终端记录。

结果

主结果是一组带点与不带点的对照:

条件试验数精确命中目标比率
带点(dotted)5,1204,83094.34%
不带点(undotted)5,1202,42347.32%

两组合计 7,253/10,240 次精确命中(70.83%)。最硬的一条是:7,253 个精确命中里,每一个都和它所在条件分配的目标一致(7,253/7,253,Wilson 95% 下界 99.95%)。带点减不带点的风险差是 47.0 个百分点,Fisher 检验 p = 1.58e-664。

但预注册的两个阈值只有一个达标:目标一致性过了(下界 99.95% > 99%),汇总精确率没过(下界 69.94%,阈值要求 75%)。

冻结复现和最初发现之间还有一道裂缝:带点条件稳定,精确率从 92.91% 微升到 94.34%;不带点条件没有复现,从 83.89% 掉到 47.32%(降 36.56 个百分点)。所以「稳定」这个结论只对带点分支成立。八个对照模块里,通用角色扮演、无系统提示、删条件从句、删完整希伯来目标、直接复制这几种都是 0/240 精确命中,说明要凑出这个现象得靠完整的希伯来身份加条件从句,光让模型随便扮演或照抄都不行。

为什么重要

作为方法论,这套冻结协议加哈希链加独立校验器的组合,是审计闭源模型行为时一个相当干净的模板,事件链和独立重放这两步是可以直接搬走的。

作为发现,它给「提示在码点层面的微小差异能精确改变模型吐出哪个具体字节序列」提供了一个可复现的样本,对做提示鲁棒性、分词器和 Unicode 行为研究、或红队行为审计的人是个有用的数据点。

要诚实的是它的边界:这既不是安全发现,也不是能力发现,更不证明任何机制、意图或跨厂商的普适性。模型是在按一套精心设计的提示办事(化身一个希伯来语身份再渲染它),对一线从业者的直接实用价值不高,它是测量层面的贡献,不是一个工具。

局限与存疑

这是个人研究者 Rayan Pal 的单作者 Zenodo 预印本,未经同行评审,参考文献里 [1] 到 [3] 还是同一作者的自引。

只测了一个模型、一个端点、一个执行窗口;采样用的是 provider 默认值(temperature 省略),没有固定随机种子,provider 行为可能漂移。

最关键的一点:希伯来语材料本身就在系统提示里。模型是被明确要求「化身」一个希伯来语身份的,所以这项研究并没有证明在没有希伯来语前置材料的情况下也会自发形成混合串。「异常」这个说法因此要大打折扣,混合串很大程度上是提示诱导出来的。

预注册的头号阈值(汇总精确率 75% 下界)没过,只有目标一致性过了;不带点分支也没复现发现期的命中率。论文自己也反复明确声明不主张机制、因果、意图、意识或跨厂商普适性,这一点的克制是恰当的。

术语

原文与代码

社区讨论

全部论文解读