探讨 Transformer 字节级嵌入与内核因子化冲突
kalomaze · x · 2026-08-19
讨论了一种在 Transformer 中嵌入字节级 token 的方法:通过拼接并投影 BPE 定义范围内的字节 token 最终隐藏状态,实现混合双向长度和块因果精确自回归。指出这种“梗因子化”方式与现代 PyTorch 及大多数基于因果 1D 序列模型输入/输出因子化对称性假设的内核不兼容。
所属事件:新思路:Transformer 字节级嵌入实现混合自回归(2 条相关)→
「研究」频道最新
- NBER 研究:Pangram 检测器误报率接近零 — soumitrashukla9 · 2026-08-19
- AI 风险真相:失控的权限比模型能力更致命 — bigdata · 2026-08-19
- 4300 个真实编码 Agent 会话实测:缓存命中高但成本仍平方级增长 — CShorten30 · 2026-08-19
- 贝叶斯观点赢得了 AI 辩论,却鲜有人察觉 — AdaptiveAgents · 2026-08-19
- 技术讨论:过确定投影在表示学习中可能优于任意嵌入表 — kalomaze · 2026-08-19
- Claude 自主设计蛋白质实验成功率35%,远超人类平均水平 — ResultBackground2450 · 2026-08-19