Ling 3.0 Tiny 对比 Gemma 26B:显存小 3 倍,任务准确率却腰斩
autonoma_2042 · reddit · 2026-09-21
一位开发者在有声书管线(为小说对白分配说话人供 TTS 配音)中,把 Ling 3.0 Tiny(7.9B 总参/1.3B 激活,Q4 约 4.8GB,可整卡塞进 8GB VRAM) 与现任 Gemma 4 26B-A4B(QAT Q4,14GB,专家驻留内存) 做了同任务 A/B 实测:
- 硬件:NVIDIA T1000 8GB(无 tensor core)+ Ryzen 5 7600 / 93GB DDR5
- Ling 架构要点:24 层中 KDA 循环注意力与 MLA 混排,128 专家路由 8+1 激活;KV cache 极小(8K 仅 54MiB),8K 上下文常驻 4.9GB;llama.cpp 主干已支持 bailingmoe3,无需 fork
- 吞吐:单个 32 条引用请求 prefill 245 tok/s、decode 54 tok/s
- 但 Ling 写出的推理文字多 50–70%,8K 上下文更易溢出需重试;且该 checkpoint 没有 NEXTN 权重,无法用 draft-mtp 投机解码
结果:在 485 行人工校准的对白归属基准上,Gemma 总体 94.6%(最差章节 90.6%),Ling 仅 56.9%(最差章节 43.8%),且章节越长差距越大;Gemma 单章耗时也更短。
结论:Ling 3.0 Tiny 虽然显存占用和吞吐漂亮,但在这种严格 JSON 抽取任务上与 26B MoE 差距悬殊,小显存优势换不来质量。
「模型」频道最新
- Tobi 称本地 Dell 服务器跑 DeepSeek 4.1 Flash,每秒约 300 tokens — BLUECOW009 · 2026-09-21
- 小众领域打标签仍是大模型软肋:聚类+二级 LLM 兜底流程实测 — FanaHOVA · 2026-09-21
- 开发者提出「decide」原语:像写 switch 一样在浏览器里跑端侧 AI — cocktailpeanut · 2026-09-21
- 爆料:GPT-6 Sol 周二发布,OpenAI 内部模型 Bel 被视作 AGI — imjustnewatai · 2026-09-21
- 实测对比:Jev 不如预期,GLiNER2 存在更优替代方案 — airesearch12 · 2026-09-21
- Nym 用超快分类模型 Jev 重构 agent,更快更便宜更可靠 — moyix · 2026-09-21