12 模型「AI 味」盲测:Fable 5.1 仅 14% 被判 AI,Gemini 3.8 达 77%
PawelHuryn · x · 2026-09-07
- Pawel Huryn 用相同 3 个写作任务(产品路线图失败原因短文、helpdesk 功能发布稿、LinkedIn 帖),每模型跑 3 次、无 system prompt,共 108 篇文本两两盲比,由 Gemini、Grok、Opus、GPT-5.6 Sol 四个 AI 评审判断哪篇更像 AI,共 1,647 次判定;被交换顺序后改变判断的约 30% 判定作废。
- 结果(被选为 AI 比例,越低越好):Fable 5.1 14%、Grok 4.6 22%、Opus 5 24%、GPT-6 Astra 30%;开源/中国系居中:GLM-5.3 55%、Kimi K3 56%、Qwen 3.8 Flash 62%;GPT-5.6 Terra 75%、Gemini 3.8 Flash 77% 最「AI 味」。
- 反转:评测由 Fable 5.1 搭建而 Fable 夺冠。因各评审不给自己打分,Fable 只由 Google、xAI、OpenAI 的模型评审,仍排第一。
- 作者还将模型 LinkedIn 帖与自己 2021-2022(ChatGPT 之前)的 15 篇旧帖对比:模型 355 次被选中,人作 0 次。数据与全部文本一小时内发布在 GitHub。
所属事件:12 模型「AI 味」盲测:Gemini 3.8 最易露馅(3 条相关)→
「模型」频道最新
- 合成数据已成训练主流:小模型训练本质是蒸馏 — RexDouglass · 2026-09-07
- Sol High 用量实测:复杂写作项目一次吃掉 5 小时限额的 5% — remixedmoon5 · 2026-09-07
- 印度非营利组织 Bodhan AI 开源全套印度语言语音视觉翻译模型 — selfawareatom · 2026-09-07
- Claude Max 用户称用量限制连续一周出现乱跳 bug — tonimedic · 2026-09-07
- 开发者提醒:Astra 擅长可展示的领域,但 AGI 关键在系统级理解 — Scobleizer · 2026-09-07
- 腾讯开源 EVIE 视觉文档检索模型,ViDoRe V3 达 66.75 — jacek2023 · 2026-09-07