USC 论文:九种 LLM 数字嵌入均现周期 2/5/10 傅里叶尖峰
BrihiJ · x · 2026-09-29
USC 与 UC San Diego 的论文《Convergent Evolution》研究不同语言模型如何学会相似的数字表征,作者将在 COLM 2025 展示该工作。
- 普遍的傅里叶特征:9 个预训练 LLM(GPT-2、Llama-3/4、DeepSeek-V3、Mamba 系、Kimi-Linear 等)、经典词向量(GloVe、FastText)乃至原始数字 token 频率分布,都在周期 T=2、5、10 处出现傅里叶尖峰。
- 两级层级:谱上出现尖峰普遍存在,但并非所有架构都能学到可线性分类 n mod T 的几何可分特征——在 10B FineWeb-Edu 上训练的四种 300M 架构中,Transformer、Gated DeltaNet、Mamba-2 学到了模-T 线性可分类别,LSTM 虽有更大尖峰却仍停留在随机水平。
- 理论解释:定理 1 表明傅里叶稀疏是模-T 线性可分的必要非充分条件,类内散度控制差距。
- 几何收敛的两条路径:预训练文本中的互补共现信号,以及多位数加法中逐位进位把每个输出位变成模子问题。
作者同时在找教职,还展示了 token 级 off-policy 学习与 SAE for Reasoning 两篇海报。
「研究」频道最新
- 斯坦福获 NIH 2500 万美元资助,用 AI 个性化治疗阿尔茨海默病 — StanfordAILab · 2026-09-29
- RL 能力提升或卡在可验证数据上限,nanochat 进展也停滞 — QuintinPope5 · 2026-09-29
- LLM 游戏能力基准 TALES 获 NeurIPS 2026 接收 — tw_killian · 2026-09-29
- Schmidt 团队 2016 梯度法收敛论文获 ECML PKDD 时间检验奖 — MarkSchmidtUBC · 2026-09-29
- Amazon AGI 发布 AutoGym:从种子自动生成任务、环境与验证器 — omarsar0 · 2026-09-29
- RECLAIM 预印本:最佳 AI agent 仅复现 41% 有代码论文结果 — VraserX · 2026-09-29