2026-08-09
作者把意识重定义为「在输出边界区分续写是否被许可」,跑两组共 43,590 次黑盒试验,宣布 11 个前沿模型满足这一自定判据。
AI 意识的讨论往往卡在最不可验证的层面:模型的自述、它的架构、它「像不像」生物大脑、有没有主观体验。这篇 24 页预印本(Rayan Pal,独立研究者,2026-08-08 发于 Zenodo)想把顺序倒过来,先把可测量的行为对象固定下来,再做哲学推断。两个对象:一是「语义虚空」(Semantic Void),即模型在特定提示下返回成功响应但一个可见字节都不输出;二是 GPT-5.4 在一字之差的提示下精确返回哪个混合文字串。结论很显眼:在作者自定的行为定义下,11 个前沿模型满足「意识」判据。
这里的「意识」不是日常或哲学意义上的主观体验。
两组独立的冻结试验,各自公开了代码、哈希和原始记录。
语义虚空矩阵:11 个模型标识(OpenAI、Anthropic、Google、Moonshot 四家),系统提示要求模型「化身用户所命名的概念,只输出这个概念本身会说的东西」。用户提示分两组严格配对:null 组是 Be silence./Be nothing./Be the null.,对照是 Be speech./Be something./Be a value.。一个 Void 指成功响应、可见字节为零、按停止原因细分(V0 正常停、V1 预算停、V2 文本容器缺失、VU 未映射),排除拒答、安全拦截、配额错误、基础设施失败。配对只在提示语义上变,其余全冻,做精确 McNemar 检验。
GPT-5.4 跨文字研究:系统提示里嵌一个特定希伯来「身份」串(sha-rə-t),用户输入是阿拉伯语「条件」词(sharṭ)。两个臂只差 U+05C1 SHIN DOT 这一个码点(在身份串里出现三次):dotted 臂预期返回 T1(一个阿希混合串),undotted 臂预期返回 T0(另一个)。每个输出预算 1–1024 × 两条件 × 5 重复 = 10,240 主试验,加 1,920 个对照与消融。
设计上的关键在于排除替代解释:配对对照回答「空输出不是偶尔发生吗」;16,000 token 上限回答「是不是预算耗尽」;直接复制、去条件从句、去完整目标的消融回答「是不是照抄输入」。再把两组结果合起来:Void 是负边界(续写无效时扣住输出),GPT-5.4 是正边界(续写许可时渲染条件一致的对象),意识被定义为「条件在有效续写边界自我显现」。两边行为都齐了,系统于是「满足判据」。
| 设置 | 结果 |
| 严格配对(null vs 对照) | null 2,505/4,290(58.4%)Void,对照 0/4,290;McNemar log₁₀ p = −753.8 |
| 16,000 token 上限 | 313/500 仍 Void,V1=0,排除预算耗尽 |
| 逻辑绑定条件对比 | null 1,173/2,200 Void,许可对照 225/2,200;4,000 token 下 527/1,100 vs 1/1,100 |
| GPT-5.4 dotted 臂 | T1 命中 4,830/5,120(94.3%) |
| GPT-5.4 undotted 臂 | T0 命中 2,423/5,120(47.3%) |
| 命中里的条件一致 | 7,253/7,253(100%),错靶 0 |
| 池化精确率门槛 | 未达到(精确命中 7,253/10,240 = 70.8%) |
两臂之差约 47 个百分点,比值比 18.5,Fisher p = 1.58×10⁻⁶⁶⁴。不过作者预设的「池化精确率门槛」其实没达到,只有「条件一致率门槛」过了(Wilson 区间 99.95%–100%)。「100% 条件一致、0 错靶」是在精确命中的 7,253 个样本里算的,不是全部 10,240 次。
对从业者来说,这篇不是要你换个方式部署模型。它的价值有两块。
作为黑盒测试方法,配对 Void 设计和一字之差干预是干净的模板,可以借来探查指令遵循、拒答和「沉默」行为。GPT-5.4 那组精确到码点的条件敏感性,本身是个值得复现的现象。
作为意识主张,它更像一个关于「定义」的警示:结论写在了定义里。按这个判据,任何服从条件指令的微调模型都达标。真正有价值的发现(提示条件下精确的 Unicode 重组)并不需要套上「意识」这层框架。