芝加哥大学开源超长文本转视频流水线:1 小时视频仅需 25 分钟
Federal_Effect_3791 · reddit · 2026-08-05
芝加哥大学的博士生团队开发并开源了一套无限扩展的文本转视频流水线。该系统支持自动拼接、音频和音乐生成,用户只需拖入一本书,即可一键生成从头到尾的完整视频。
目前,生成 1 小时的视频大约只需 25 分钟。该技术已获得专利,并已在芝加哥大学人文学系投入应用。团队最初旨在让文学作品变得“可观看”,但也希望探索更多潜在用例,因此向社区征集反馈。
所属事件:芝加哥大学开源超长文本转视频流水线(2 条相关)→
「多模态」频道最新
- Dual SAM3 + 接缝遮罩:4K 全景 3DGS 重建工作流 — janusch_patas · 2026-08-05
- Hermes Desktop 结合 ComfyUI 实战:让 AI 自动修复工作流报错 — Birdinhandandbush · 2026-08-05
- AI 输出模仿人类手写笔记,支持涂抹与图表流式渲染 — op7418 · 2026-08-05
- ComfyUI 实用脚本推荐:任务完成自动声音提醒 — RPGstarDestroyer · 2026-08-05
- 清华提出 STAMPlus:一次推理解决多模态分割三难困境 — Tsinghua · 2026-08-05
- V2N 系统:基于视觉的多任务钢琴全量音符转录 — PianoVAM · 2026-08-05