字节级包装层让语言模型逐字母读文本,成本几乎不变

bravo_abad · x · 2026-10-08

大多数语言模型以 token 为单位读取文本,token 内部的字母没有被单独表示——这解释了为什么模型能写出流畅文本却难以重排单词字母,而在 DNA 序列这类场景中,一个字母的改变就可能改变基因功能。

Minixhofer 等人的方法不重建模型,而是给预训练 transformer 套上小型字节级层:编码器逐字节读取文本,把字节分组为初始时模仿原 token 的 patch,中央 transformer 仍按 patch 处理一个单元,因此计算成本接近原模型;解码器再逐字节写出输出。模型由此获得真正的字符级读写能力。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →