12 模型「AI 味」盲测:Gemini 3.8 最易露馅
Pawel Huryn 对 12 个模型进行「AI 味」盲测:用 3 个相同写作任务(限 500 词、无 system prompt),每模型跑 3 次。结果显示 Fable 5.1 仅 14% 被判为 AI,Gemini 3.8 高达 77%;人类对照采用其 ChatGPT 出现前的 15 篇旧帖,人类写作 0 次胜出,另有约 30% 判定因呈现顺序翻转而作废。原始数据、脚本与复现材料已全部开源至 GitHub。
2026-09-07 ~ 2026-09-07 · 3 条相关
- 12 模型「AI 味」盲测:Fable 5.1 仅 14% 被判 AI,Gemini 3.8 达 77% — PawelHuryn · 2026-09-07
- AI 味盲测细节:人作 0 次胜出,30% 判定因顺序翻转作废 — PawelHuryn · 2026-09-07
- AI 味盲测结果与全部文本已上线 GitHub,含完整复现脚本 — PawelHuryn · 2026-09-07