10-16GB 显存可跑模型大排名:Gemma 4 26B-A4B 居首,仅 200B 以上模型懂动漫梗
WEREWOLF_BX13 · reddit · 2026-10-12
Reddit 用户发布一份面向 10-16GB VRAM(26-32GB RAM)本地角色扮演/对话场景的模型实测排名,评估维度包括速度(≥10 t/s)、连贯性、多语言容错、slop 措辞频率、MoE vs 全量、审查度与指令遵循(配合 23 条 Pandora 指令测试):
前排模型:
- Gemma 4 26B-A4B:对话与幽默优于 Qwen 35B-A3B;
- Qwen 3.6 35B-A3B(Abliterated):快且准,但易过拟合格式;
- Gemma 4 Instruct 19B-A1B Heretic;4. The Omega Directive 14B(低 slop、书写好);5. GLM-4.7-Flash 31B-A3B(Abliterated)……共 14 款上榜。
关键经验:
- 直接选 Q4K 以上量化即可,尺寸影响不大;
- 作者认为 CoT 模型在此场景浪费 token 且更慢,直接不用;
- 知识测试发现只有 200B 以上模型才真正掌握动漫/影视/音乐冷知识,120B 都很少记得,但普通人根本跑不动。
「模型」频道最新
- $/M tokens 定价失真:Opus 5.5 同任务实际成本近 Sonnet 两倍 — lordmairtis · 2026-10-12
- 数学圈抵制 OpenAI 模型生成证明:未经独立验证只是一纸声明 — ZeeshanZiaML · 2026-10-12
- 搜索 plane 匹配不到聊天记录,Claude 连子串搜索都做不好 — AaronBergman18 · 2026-10-12
- 网友吐槽:各版本 Claude 都偏爱「carried/held」这类词 — repligate · 2026-10-12
- Claude 3 Opus 角色扮演触发「不可能判定」,文案刷屏 AI 圈 — repligate · 2026-10-12
- 微软悄然上线 Decision-1:输出校准概率的「决策打分」模型 — usamawahabkhan · 2026-10-12