数错字母不全是分词的锅:LLM 能 100% 拼对每个字符

maksym_andr · x · 2026-09-21

针对「前沿 LLM 数不准字母是 tokenization 导致」的流行解释,作者提出一个反驳观察:训练时模型确实只看到 token ID 而非裸字符,但任何前沿模型都能 100% 准确地逐字符拼写出文本——即完全掌握 token ID 与字符的映射。

既然「看到哪些字符」没问题,那么数错字母的瓶颈更可能出在计数/聚合这类操作本身,而非分词让模型对字符「失明」。tokenization 会产生奇怪效应,但并不能推出模型看不见确切字符。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →