图生视频模型 Prism 登上 Hugging Face 趋势榜,MIT 协议开源
FrancisRing · hf · 2026-10-07
FrancisRing 发布的 Prism 模型登上 Hugging Face 趋势榜,是一个 image-to-video 管线的视频扩散 Transformer。
技术亮点包括联合视频-音频生成、稀疏注意力、高分辨率输出,支持 diffusers 与 safetensors 格式,论文编号 arxiv:2610.05416,采用 MIT 许可证开源。
「多模态」频道最新
- ID-Forcing 方法让自回归视频模型无需微调生成分钟级长视频 — _akhaliq · 2026-10-07
- Google 多模态嵌入模型:图像 280 token、音频每秒 25 token 计价 — tomaarsen · 2026-10-07
- Google 多模态嵌入模型:视觉 token 预算 70 至 1120 可调 — tomaarsen · 2026-10-07
- 嵌入模型任务前缀指南:SearchQuery 配 Document 做检索 — tomaarsen · 2026-10-07
- Matryoshka 训练加持:嵌入维度可裁至 256d 存储省三分之二 — tomaarsen · 2026-10-07
- 斯坦福提出 Level-of-Token DiT:让预训练扩散模型支持任意尺寸 token 网格 — GordonWetzstein · 2026-10-07