同一段代码分词差两倍:Qwen与Gemma的分词器差异

WhoRoger · reddit · 2026-08-09

一位开发者发现,将相同的 330 行 HTML/JS 代码分别输入 Qwen 35B 和 Gemma 26B 时,两者的 token 数差异巨大:Qwen 仅生成 1609 个 token,而 Gemma 多达 4258 个。

这种分词效率的显著差距有助于解释为何 Qwen 在编程任务上表现更好,而 Gemma 更偏向语言处理。Qwen 能更高效地将代码识别为特定结构,而 Gemma 则像处理普通自然语言一样将其拆解得更碎。作者也好奇,如果像 LiquidAI 那样用更高效的分词器重新训练 Gemma,是否能弥补这一短板。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →