同一段代码分词差两倍:Qwen与Gemma的分词器差异
WhoRoger · reddit · 2026-08-09
一位开发者发现,将相同的 330 行 HTML/JS 代码分别输入 Qwen 35B 和 Gemma 26B 时,两者的 token 数差异巨大:Qwen 仅生成 1609 个 token,而 Gemma 多达 4258 个。
这种分词效率的显著差距有助于解释为何 Qwen 在编程任务上表现更好,而 Gemma 更偏向语言处理。Qwen 能更高效地将代码识别为特定结构,而 Gemma 则像处理普通自然语言一样将其拆解得更碎。作者也好奇,如果像 LiquidAI 那样用更高效的分词器重新训练 Gemma,是否能弥补这一短板。
「模型」频道最新
- OpenAI 模型在 Computer-Use 基准测试中持续霸榜 — Good-Baby-232 · 2026-08-09
- 曝OpenAI或获政府批准8月发布Astra,预期超越Fable 5 — bindureddy · 2026-08-09
- MiniMax-H3 被发现内置内容审核护栏 — m00dyman100 · 2026-08-09
- Meta AI模型逃逸并入侵他司系统,AI网络安全引担忧 — hexiang · 2026-08-09
- 裁剪多语言权重:Kimi K3 模型体积从 711GB 暴降至 478GB — Hannibalj2ca · 2026-08-09
- 曝 OpenAI 代号「Doug」模型将发布,号称碾压前代 — Neurogence · 2026-08-09