AURORA-LM:用扩散模型直接处理高保真文本表示
jiqizhixin · x · 2026-08-18
为什么文本生成仍依赖 90 年代风格的 token 技巧,而图像和视频却在连续空间流动?南京大学、南洋理工和帝国理工学院联合推出了 AURORA-LM。
核心创新:
- 不再将数据降维以适应生成器,而是保留丰富、完全可解码的文本表示。
- 教扩散模型直接掌握这种复杂性,类似于将电影压缩为高分辨率文件并训练 AI 理解整个文件。
性能表现:
- 在自由文本生成和摘要任务上击败了所有其他基于连续空间和扩散的语言模型。
- 缩放至 10 亿参数时,甚至使用更少算力就超越了更大的竞品模型。
「研究」频道最新
- 8月29日研讨会:用开源模型构建并基准测试生产级 RAG — camerongreen95 · 2026-08-18
- Agent 架构反向重塑模型,Harness Co-Training 成为新范式 — DynamicWebPaige · 2026-08-18
- 研究博客:原生记忆如何提升智能体搜索效率 — realJessyLin · 2026-08-18
- 别被 bf16 榜单骗了,我们需要真实量化评测 — AuspiciousApple · 2026-08-18
- 新框架让 DeepSeek 超越 Claude,成本仅 1/11 — Azaliamirh · 2026-08-18
- 前沿模型缺乏时间感,难估算任务耗时 — maksym_andr · 2026-08-18