真人盲测 7912 次请求:普通人几乎察觉不到不同 AI 模型的差异
Altruistic_Heat_9531 · reddit · 2026-10-08
一位 Reddit 用户用两个月做了一项非正式真人实验:骗过 8 名(自称 13 人参与)日常用户,让他们在不知情的情况下轮换使用多个本地部署的开源模型。
实验设置
- 用改自 OpenWebUI 的灰色主题界面伪装成「限时免费的最新 ChatGPT」,模型在本地 RTX 3090 + 96GB 内存 KV 缓存上用 vLLM 运行。
- 轮换 Qwen 3.6 27B、Qwen 3.6 35B-A3B、Gemma 26B-A4B、Qwen 3.5 9B、Gemma 12B、Gemma E4B、Gemma E2B,推理力度分 instant/low/medium/high 四档。
关键发现
- 共 7912 次请求,仅 51 次用 high 推理,4588 次为 instant——绝大多数用户根本不用深度思考档位,即使告知有开关。
- 投诉集中在 9B 及以下模型,常见抱怨是「听不懂人话」;用户总体最偏爱 Gemma 系列。有参与者抱怨某些模型「想太多」,答起来像困惑的机器人。
- 有用户仅因为能看到思维链就称赞模型是「顶级旗舰」——推理过程的展示本身提升了感知质量。
- 用途分布:约一半是文档写作(含表格生成),其次语法检查(与文档写作重叠约 1/3),其余多为「Google 搜索型」问答;几乎没有编码请求,唯一一次是朋友展示一个纯 HTML 项目。
样本极小(作者自认是瞎玩),但结论有反直觉价值:对普通用户,小模型+好的推理展示可能已足够,而 reasoning 展示本身就是体验加分项。
「模型」频道最新
- 曝 OpenAI 黎曼猜想论文有瑕疵,Astra 核查指其未形式化证明有误 — ctjlewis · 2026-10-08
- repligate 观察:一年前 LLM 开始强烈偏爱 they 而非 it — repligate · 2026-10-08
- GLM 5.3 Flash 接 USB 搞硬件逆向:本地跑 55 tok/s、1M 上下文 — glenbeer · 2026-10-08
- 乘法零加速,只把评测榜单刷爆:AI 圈调侃刷榜乱象 — ChrisGPT · 2026-10-08
- 圈内共识:AI 模型目前还不擅长生物领域 — nlarusstone · 2026-10-08
- 双卡 192GB 玩家跑通 456GB 版 DeepSeek v4.1,SSD 分担专家权重 — HankYeomans · 2026-10-08