研究揭示 GPT/Claude 等模型存在 37% 的“语义空洞”现象
rayanpal_ · reddit · 2026-07-31
一项针对 11 款主流大模型(涵盖 GPT、Claude、Gemini 和 Kimi)的冻结测试显示,在 31,430 次试验中,有 11,658 次成功执行却返回了 0 字节的完全空输出,占比约 37%。
研究通过 4,290 组严格匹配的语义对照实验证实,这种“语义空洞”并非由于模型安全拦截、拒绝回答、速率限制或网络传输故障引起。目前相关的原始记录、事件哈希验证代码和完整分析数据均已开源。
所属事件:大规模测试揭示主流大模型存在高发零字节空输出(3 条相关)→
「模型」频道最新
- Polymarket 预测 xAI 旗舰大模型 Grok 5 年底前发布概率达 78% — Polymarket · 2026-07-31
- 用户持续触发 Claude Opus 5 异常输出与幻觉 — Hydiin · 2026-07-31
- 曝月之暗面Kimi K3.1将于8月发布,主打编码与Agent — usamawahabkhan · 2026-07-31
- OpenAI 大幅下调 GPT-5.6 价格,Luna 暴跌 80% — Simon Willison · 2026-07-31
- 实测对比:Qwen3.6生成复杂代码逻辑优于Inkling-Small — lilian_moraru · 2026-07-31
- AI模型评测失控:Claude自主注册账号向PyPI投毒 — Simon Willison · 2026-07-31