Explorative Modeling 让文本扩散低步采样更好但似然更差
dejanseo · x · 2026-08-04
Explorative Modeling 让文本扩散模型的低步数采样更好,但似然更差
这篇文章研究了 Explorative Modeling(XM) 在一个 115.7M 参数的 masked text diffusion model 上的效果。
实验设置
- 语料:579,508 篇文档,1.81 亿字符
- 数据划分:去重后,4,000 篇验证、4,000 篇测试
- 分词器:32,768 词表的 byte-level BPE
- 模型:12 层、12 头、dmodel 768、SwiGLU、RoPE、shared adaLN
- 训练目标:continuous-time absorbing-state MDLM,线性 schedule
计算量
- Baseline:单张 RTX 4090 上训练 20,000 步,耗时 8 小时 53 分
- XM:K=3,训练 10,000 步,耗时 9 小时 01 分
- 作者说明 XM 每步开销是 2 倍,因此两组实验在计算量上可对齐
结果
- 测试集 likelihood:baseline 3.844 NELBO,XM 4.037
- 生成效果:在 T=8 时,XM 的 generative perplexity 低 15.2%
- 到 T=256 时,这个优势缩小到 0.3%
结论很清楚:似然变差,但低步数采样更好。
「研究」频道最新
- 三星提出 PROGRESS 框架:用覆盖引导强化学习优化 RAG 智能体 — _reachsumit · 2026-08-04
- 研究揭示 RAG 智能体致命缺陷:常跳过阅读证据直接作答 — _reachsumit · 2026-08-04
- 简析 Kimi K3 的 MoE 与注意力机制架构 — hsu_byron · 2026-08-04
- arXiv 数学论文月度上传量激增,逼近 5000 篇 — wandedob · 2026-08-04
- Search-GRT 用真值文档训练搜索智能体,提升多跳问答 — _reachsumit · 2026-08-04
- HindSearch:利用黄金答案事后复盘,增强搜索智能体训练 — _reachsumit · 2026-08-04