Intern Lumina U2 发布:扩散大模型统一图文视频与 3D 理解
bdsqlsz · x · 2026-09-05
上海人工智能实验室 Intern 团队推出 Intern Lumina U2,一个多 codebook 扩散大语言模型,统一了文本、图像、视频与 3D 的理解和生成能力。
- 能力覆盖:文本问答、图像理解与编辑、图像生成、视频理解、3D 理解,比一般统一模型额外支持视频与 3D。
- 初步评测:ChartQA 86.52、CharXiv-DQ 83.65、HallusionBench 62.15、MMMU-Pro 36.13,多超过 InternVL-UL、LLaDA2.0-Uni、LLaDA-o 等对比模型;视频理解与 Video-MME 51.26 接近最优;生成侧 GenEval 0.81、DPG 87.10 略逊于部分对手。
- 方法:共享 MoE Diffusion LLM 主干,用离散 VQ 层级表示视觉 token,空间位置并行处理、codebook 顺序解码。
页面、代码与模型均已开源,完整技术报告待发布。
所属事件:上海AI实验室发布Lumina U2统一视觉理解与生成(2 条相关)→
「模型」频道最新
- Simon Willison 用骑自行车鹈鹕实测 GPT-6 Astra:全面碾压 GPT-5.6 — Simon Willison · 2026-09-05
- Meta 公开 Muse Spark 1.3 max:编程与 Agent 能力显著增强 — EdwardSun0909 · 2026-09-05
- GPT-6 Astra 横扫 ARC-AGI-3:标准 66%,专用 harness 近满分 — AccBalanced · 2026-09-05
- GPT-6 Astra 演示被批:开头 17 秒暴露 AI 创意工具通病 — plopesresearch · 2026-09-05
- Astra 号称省 token 却涨价:$20 套餐 5 小时只够用 1.5 次 — oran_ge · 2026-09-05
- 补充分享:Astra 删码并非被要求 deslop — Sauers_ · 2026-09-05