模态动力学字体:用有限元振动模式驱动冻结视频扩散做字形动画
Maham Tanveer · hf · 2026-10-05
notredame 团队提出 modal kinetic typography:让矢量字形动起来表达语义概念,同时保持可读性。
核心思路:用字形自身的「自然振动模式」构建运动——从矢量轮廓组装有限元特征值问题,得到整字与各部件的最软模态(可弯曲),零能量解(刚体平移/旋转)以闭式解应用于各部件。动画时,冻结的视频扩散模型只监督模态的振幅与相位。
相比前方法的优势:
- 基于 SDS 的自由点优化沿噪声梯度逐点移动,撕裂轮廓、产生抖动;模态沿轮廓平滑、由少数整周期谐波驱动,运动平滑无缝循环;
- 结构化方法依赖类别特定骨架/关键点先验,而模态来自字形本身,唯一先验是 LLM 一次性生成的字母部件表;
- 形状与运动构造性解耦:模态驱动不会改变基础轮廓,可只动形状不变。
评测:在概念对齐相当或更好的情况下,运动更流畅、轮廓撕裂更少,优于 Dynamic Typography 与 AniClipart,人类评估者偏好度高于 Astra (GPT-6) 的结果。
「多模态」频道最新
- AI 生成恶搞视频已难辨真伪,B 站相关内容井喷 — minchoi · 2026-10-06
- Geometry Duo 登陆 ComfyUI:白模+法线引导视频生成的几何稳定性 — Narrow-Particular202 · 2026-10-06
- 不花 API 钱:Edge TTS 并行流式脚本实现逐句实时语音播放 — Speedk4011 · 2026-10-06
- 12GB显卡本地跑MiniMax H3做电影预告片:0.6MP+4:3是甜点 — vortis23 · 2026-10-06
- 网友让Opus 5.5自编自导短片:用Python+Pillow全程序化生成 — danjr000 · 2026-10-05
- 单张 RTX 4090 跑全双工语音助手 Speakrail,部分基准叫板 GPT-Live — danil_rootint · 2026-10-05