探讨 Transformer 字节级嵌入与内核因子化冲突

kalomaze · x · 2026-08-19

讨论了一种在 Transformer 中嵌入字节级 token 的方法:通过拼接并投影 BPE 定义范围内的字节 token 最终隐藏状态,实现混合双向长度和块因果精确自回归。指出这种“梗因子化”方式与现代 PyTorch 及大多数基于因果 1D 序列模型输入/输出因子化对称性假设的内核不兼容。

所属事件:新思路:Transformer 字节级嵌入实现混合自回归(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →