数错字母不全是分词的锅:LLM 能 100% 拼对每个字符
maksym_andr · x · 2026-09-21
针对「前沿 LLM 数不准字母是 tokenization 导致」的流行解释,作者提出一个反驳观察:训练时模型确实只看到 token ID 而非裸字符,但任何前沿模型都能 100% 准确地逐字符拼写出文本——即完全掌握 token ID 与字符的映射。
既然「看到哪些字符」没问题,那么数错字母的瓶颈更可能出在计数/聚合这类操作本身,而非分词让模型对字符「失明」。tokenization 会产生奇怪效应,但并不能推出模型看不见确切字符。
「模型」频道最新
- Hesamation 补充 DeepSeek 国产芯片训练计划细节 — Hesamation · 2026-09-21
- 爆料:DeepSeek 正训练 2T 参数模型,8T 也在规划中 — Hesamation · 2026-09-21
- Codex PRO+ 用户抱怨额度消耗疑似变快:4 次提示耗掉 5% — Next_Technology6361 · 2026-09-21
- 开源微调项目 laya 星标 6.9k,附 Kaggle 双 T4 微调笔记本 — ojasvi_yadav · 2026-09-21
- jev-reranker 日文检索基准实测:四项任务反超 ruri-v3 — amaarora · 2026-09-21
- 新模型漏洞利用数据与前代相当,AI 网络安全风险争论再起 — xeophon · 2026-09-21