GPT-5.6 Sol与Claude Fable 5涂鸦识读对比引发幻觉争议
07-12,@goodside 用一张“闭眼在手机上乱画”的无意义涂鸦,实测 GPT-5.6 Sol 与 Claude Fable 5 阅读手写的能力,发现两者反应截然不同:Sol 会稳定地“编”出一个答案,表现出明显的幻觉倾向;Fable 5 则直接承认读不出来,甚至会反驳说这根本不像字。这则对比在社区里被广泛转发,被视为当下模型“知之为知之”差异的直观案例。
测试设计
素材本身是刻意制造的无意义输入——闭眼随手乱画,既不是字也不像图案,因此任何“读出某内容”的回答都属于编造。@goodside 最初给出的两个例子都把 Sol 设在 high effort 档位,且没有尝试更高档位。
后续修正与争议
07-13,@goodside 更新称 Sol Pro 以及更高 effort 的 Sol non-Pro 往往能正确处理同类例子,并附上了 ChatGPT 分享链接。但他随后在 5.6 Sol Pro 上做了 3 次尝试,仍然观察到幻觉行为,测试时关闭了个性化和记忆。面对外界“更高档位能答对”的说法,他强调在全新对话、关闭个性化与记忆的条件下 5.6 Sol Pro 仍能 3/3 稳定复现幻觉,并指出此前提到的第三个例子依旧存在。综合来看,问题是否随 effort/Pro 档位消失,在不同用户与测试条件下结论并不一致。
2026-07-12 ~ 2026-07-13 · 5 条相关
一手来源
- 两款模型读涂鸦:一个乱猜一个拒答 — goodside ·
- 5.6 Sol Pro仍可复现幻觉 — goodside ·
- 两个模型读涂鸦的反应对比 — goodside · 2026-07-12
- ChatGPT Sol高努力也能答对 — goodside · 2026-07-13
- Sol Pro 仍被测出幻觉问题 — goodside · 2026-07-13
- 【源头】5.6 Sol Pro仍可复现幻觉 — goodside · 2026-07-13
另有 1 条近重复转述:goodside