用户实测 Gemini 3.8 Flash 幻觉频发,Claude 与 ChatGPT 全对
DK1530 · reddit · 2026-09-13
一位重度 Gemini 用户用 5 道韩漫(GO-SU)相关韩文提示词(含轻微拼写错误)横向测试三款模型:
- Gemini 3.8 Flash(App 版,无扩展思考):从第 2 题开始出现幻觉。
- Claude 5 Sonnet(免费档):5 题全部答对。
- ChatGPT(免费档,未显示模型名):5 题全部答对,但上下文中有少量幻觉信息。
作者因结果失望,又补测两项:Google AI Mode 与 Google AI Studio 中的 Gemini 3.8 Flash 均 5 题全对。作者据此认为 App 版 Gemini 3.8 Flash 表现明显更差,并强调这只是个人娱乐性小测试。
「模型」频道最新
- Bindu Reddy:AI 放缓论正中谷歌下怀,Gemini 4.0 或廉价且强大 — bindureddy · 2026-09-13
- 研究员提名 Pliny、Janus、Lisan 任前沿模型第三方审计 — DimitrisPapail · 2026-09-13
- Vectorspace 创始人:天天忍受前沿模型的 slop,网上却吹超人类 — lateinteraction · 2026-09-13
- 传闻 DeepMind 内部已出现「递归自我改进」,真实性存疑 — MrSnowden · 2026-09-13
- 月之暗面官方辟谣创始人被捕,但未否认蒸馏传闻 — pstAsiatech · 2026-09-13
- 曝 OpenAI、xAI 首次跟进展缓 AI,与 Anthropic 三方同调 — AIFlow_ML · 2026-09-13