Chimera 视觉生成模型:引入 LLM 架构实现单次扫描
SonglinYang4 · x · 2026-08-02
研究团队发布了视觉生成模型家族 Chimera。该模型将现代 LLM 的混合线性注意力机制与扩展协同设计引入视觉生成领域。
核心创新包括:
- mShortConv:一种向模型传递数据维度信息(文本 1D、图像 2D、视频 3D)的简单方法,即使数据被展平为同一序列也能生效。
- 结合 KDA 技术,模型能够实现单次扫描且无需位置编码。
所属事件:Chimera视觉生成模型引入LLM架构(2 条相关)→
「多模态」频道最新
- NAPE 音频预训练法开源:无解码器 SOTA — kastnerkyle · 2026-08-24
- MiniMax H3 本地生成 Pudgy Penguins 音乐视频 — cocktailpeanut · 2026-08-24
- Thrixel 一小时生成可玩 3D 森林与 BOSS — RanaHanocka · 2026-08-24
- 30 年动画人用 AI 赋予角色生命,作品 The Latent Stroke — Paferkas-71 · 2026-08-24
- 用 Minimax H3 制作风世界开场动画,含完整工作流 — Routine_Ad_3391 · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24