受控实验比较 token、字节与像素编码:没有一种编码全面占优
delliott · x · 2026-10-06
哥本哈根大学 Desmond Elliott 团队发布论文《Rate-Utility Frontiers for Language Encodings》,在受控条件下比较 subword token、原始字节与渲染像素三种文本编码方式。
- 实验使用覆盖 13 种语言、5 种文字系统的对齐平行句,通过可调宽度的共享瓶颈描出速率-效用前沿,分离出序列长度、潜在容量与压缩后任务信息三个常被混淆的量。
- 评测三类下游效用:表面形式保留、跨语言句子对齐、主题分类。
- 结论:没有一种编码在所有任务或容量区间占优——像素最擅长保留表面形式,字节最擅长跨语言对齐(同文字系统多语言场景尤甚),token 最擅长主题预测;且这些表现不能仅用序列长度解释。
同帖还推荐了 Danae Savi 的另一篇论文,指出开源权重 VLM 在 CoT 推理过程中似乎并不修正其初始预测。
「模型」频道最新
- Mustafa Suleyman 曾称幻觉 2025 年基本消除,如今被群嘲 — PMinervini · 2026-10-06
- 爆 GPT-6 Astra 致配额滥用,Pro 20x 周配额疑遭腰斩 — teortaxesTex · 2026-10-06
- Laya 开源决策模型:33 毫秒输出校准概率,百种语言 — victormustar · 2026-10-06
- 实验室新实验首次诱导并观测 LLM 忠实内省的神经足迹 — davidbau · 2026-10-06
- Anthropic 再收紧护栏:Claude Code 突然拒绝编辑 Terraform 变量文件 — basedjensen · 2026-10-06
- Hugging Face 员工预告:10 月将是一个密集发布月 — mervenoyann · 2026-10-06