DLCM 论文:从 token 转向概念建模,推理快至 3.3 倍
burny_tech · x · 2026-09-03
Ge Zhang 转发的新论文提出 Dynamic Large Concept Models(DLCM),主张「建模概念而非 token」。论文核心内容:
- 动机:LLM 对所有 token 施加均匀计算,但语言信息密度高度不均——大量算力浪费在局部可预测片段,语义关键转折却算力不足
- 方法:分层语言建模框架,从潜在表示端到端学习语义边界,把计算转移到压缩的概念空间;无需预定义语言学单元即可发现变长概念
- 压缩感知 scaling law:首个将 token 级容量、概念级推理容量与压缩比解耦的 scaling law,支持固定 FLOPs 下的有原则算力分配
- 解耦 μP 参数化:支持跨宽度与压缩 regime 的零样本超参迁移,稳定训练异构架构
- 论文另附 Next-Latent Prediction 方向,称可带来最高 3.3 倍的自推测解码加速
arXiv: 2512.24617,作者含 Xingwei Qu、Ge Zhang、Wenhao Huang 等 19 人。
「研究」频道最新
- 悬置 30 年的逻辑难题被 ChatGPT 解决:稳定分叉猜想被推翻 — Dr_Singularity · 2026-09-03
- PufferLib 5.0 自博弈演示:$700 电脑 5 分钟训练双 agent 帆船对战 — yacineMTB · 2026-09-03
- Until Labs 用 AI 筛选超 25 万分子,破解玻璃化冷冻保护剂难题 — lukaszkaiser · 2026-09-03
- Schmidhuber 再谈世界模型源流:2015 年论文已论及抽象思维规划 — jonasgeiping · 2026-09-03
- 斯坦福学者提出「What-If 机器」:用 AI 行为模拟预演商业决策 — msbernst · 2026-09-03
- 字节跳动研究:循环 Transformer 计算效率反超,加深模型或非最优解 — georgejrjrjr · 2026-09-03