字节级包装层让语言模型逐字母读文本,成本几乎不变
bravo_abad · x · 2026-10-08
大多数语言模型以 token 为单位读取文本,token 内部的字母没有被单独表示——这解释了为什么模型能写出流畅文本却难以重排单词字母,而在 DNA 序列这类场景中,一个字母的改变就可能改变基因功能。
Minixhofer 等人的方法不重建模型,而是给预训练 transformer 套上小型字节级层:编码器逐字节读取文本,把字节分组为初始时模仿原 token 的 patch,中央 transformer 仍按 patch 处理一个单元,因此计算成本接近原模型;解码器再逐字节写出输出。模型由此获得真正的字符级读写能力。
「研究」频道最新
- KAIST 提出 SQAM:流策略强化学习微调提速,OGBench 难题成功率最高提升 35 个百分点 — kaist-ai · 2026-10-08
- 三篇霍奇猜想论文齐撤稿:符号错误连坐,LLM 数学成果引质疑 — ziv_ravid · 2026-10-08
- IBM 将 Spyre AI 加速器接入 PyTorch,借原生设备抽象实现一套框架多硬件 — PyTorch · 2026-10-08
- ResearchTrails 从 Git 提交史提取人类研究决策轨迹,提升 LLM 科研辅助能力 — ChenhaoTan · 2026-10-08
- Toby Ord 提出插值-外推-超外推三分法,称 AI 拙于第三类 — tobyordoxford · 2026-10-08
- 开发者热议:ColBERT 式 late interaction 还算不算 cross-encoder 重排器 — CShorten30 · 2026-10-08