实验表明语言模型不用可训练输入嵌入表也能学会语言
A. Bochkov · hf · 2026-10-07
A. Bochkov 发布一组单次运行对照实验:在相同 tokenizer、backbone、untied 输出头和训练配方下(每模型约 1000 亿预测 token 预算),从零训练三个 decoder-only 模型,输入端分别用可学习嵌入表、规范 16-bit token ID 编码、以及 GF(2) 上的一种固定可逆重编码。
主要发现
- 两个固定编码模型都获得了可观能力:规范编码在 HellaSwag 归一化准确率 52.40%、PIQA 70.51%、LAMBADA 42.75%。
- 可学习嵌入的对照模型在 HellaSwag、LAMBADA 等多项评测上仍更好,因此结论是「可行性」而非「性能持平」。
- 固定输入接口移除 1.007 亿可训练参数(模型为 1.711B),但作者强调参数缩减不是核心结论。
意义:实验区分了「架构必要性」与「实证收益」——独立可训练的逐 token 输入向量并非这些能力的必要条件;固定身份接口还为研究不可变输入下游的表征学习提供了受控设置。
「模型」频道最新
- 传 OpenAI 手握两批数学证明尚未发布 — basedjensen · 2026-10-07
- Claude Opus 5.5 按公开数据生成 600 零件涡扇发动机并可模拟气流 — bookwormengr · 2026-10-07
- Mistral Large 4 实测 STEMBench 表现亮眼 — GuillaumeLample · 2026-10-07
- Mistral 开源 1 万亿参数 Large 4,号称「Le Chonk」挑战美中顶级模型 — Ars Technica AI · 2026-10-07
- 曝 Google 原型语音智能体「Concierge」,或为 Gemini 4 预热 — testingcatalog · 2026-10-07
- Mistral Large 4 登顶 Harvey 法律 Agent 基准,居开源模型首位 — MistralAI · 2026-10-07