实验表明语言模型不用可训练输入嵌入表也能学会语言

A. Bochkov · hf · 2026-10-07

A. Bochkov 发布一组单次运行对照实验:在相同 tokenizer、backbone、untied 输出头和训练配方下(每模型约 1000 亿预测 token 预算),从零训练三个 decoder-only 模型,输入端分别用可学习嵌入表、规范 16-bit token ID 编码、以及 GF(2) 上的一种固定可逆重编码。

主要发现

意义:实验区分了「架构必要性」与「实证收益」——独立可训练的逐 token 输入向量并非这些能力的必要条件;固定身份接口还为研究不可变输入下游的表征学习提供了受控设置。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →