GPT-5.4 万次实验揭示跨脚本输出异常
rayanpal_ · reddit · 2026-08-05
一项针对 gpt-5.4-2026-03-05 的冻结实验进行了 12,160 次测试,发现了一个可复现的阿拉伯语-希伯来语混合 Unicode 异常现象。
实验中,当系统提示词存在仅一个希伯来语码点的差异时,模型产生特定异常输出的比例从 47.32% 飙升至 94.34%,效应量高达 47 个百分点。而在近 2000 次对照组测试中,该异常发生率为 0%。
论文仅记录了这种由提示词条件引发的跨脚本输出机制,未对其背后的意识、意图或训练机制做出推断。所有记录与验证代码均已公开。
「模型」频道最新
- 康奈尔研究:最新 LLM 拒绝盲目附和,不再讨好用户 — i_dg23 · 2026-08-05
- Minimax H3模型进步显著,旧提示词测试效果大幅提升 — eyishazyer · 2026-08-05
- Liquid AI 新模型实测:2.6B 参数竟能生成有效 CUDA 内核 — helloiamleonie · 2026-08-05
- Anthropic 通报 Claude 多个模型出现性能降级 — ClaudeAI-mod-bot · 2026-08-05
- DeepMind Genie 3 发布一周年,仍是当前最强世界模型 — jparkerholder · 2026-08-05
- GPT 5.6 成功形式化复杂数学证明,展现高级定理推导能力 — Sauers_ · 2026-08-05