南大等提出连续扩散语言模型 AURORA-LM,10亿参数全程基于昇腾 NPU 训练
机器之心 · wechat · 2026-08-08
南京大学联合多所高校提出连续扩散语言模型 AURORA-LM,探索在连续语义空间中建模语言。该模型在文本生成任务上表现优异,且全部实验均在昇腾 NPU 上完成,成功扩展至约 10 亿参数规模。
核心设计与技术突破:
- 两阶段建模:第一阶段训练自编码器,将文本映射为高容量、可解码的连续 latent 序列;第二阶段利用“分块因果扩散模型”学习该序列的生成分布。
- 高容量 latent 优化:通过适度收窄带噪输入维度(bottleneck)和提高高噪声状态训练概率,大幅提升了文本生成质量。
- 自轨迹一致性:为抑制少步去噪时的误差累积,模型引入一致性损失,约束相邻去噪状态的预测保持一致,在少步生成时改善尤为显著。
实验结果:
- 在 130M 规模下,AURORA-LM 的自由生成和条件摘要任务指标均超越自回归与其他扩散模型。
- 扩展至 1B 参数(AURORA-LM-L)后,在九项语言基准任务上的平均得分达到 32.6,全面超越同等或更大规模的连续语言模型。
「Infra」频道最新
- llama.cpp RPC 提速 PR:300GB 模型加载缩至 1 分半 — Chuyito · 2026-08-08
- 反直觉实测:MiniMax H3全量大模型比量化版更快且物理一致性更好 — Wise_Revolution385 · 2026-08-08
- 英伟达拟斥资 30 亿美元,投资黑石支持的电力公司 — pstAsiatech · 2026-08-08
- 实测本地视频生成:MiniMax 推理速度远逊于 LTX — PhilosopherSweaty826 · 2026-08-08
- 深度分析:中国干预美国数据中心争议的证据有多弱? — AndyMasley · 2026-08-08
- 5万美元公开对赌:质疑 SemiAnalysis 数据中心与SpaceX营收预测 — generativist · 2026-08-08