开源 NaFlexCLAP:支持可变分辨率的音频-文本多模态模型
wightmanr · x · 2026-08-14
知名视觉模型研究者 Ross Wightman 分享了其最新的实验模型集合 NaFlexCLAP,目前已开源在 Hugging Face 上。
- 技术特点:该项目将 timm 的 NaFlexViT 音频编码器与现代文本编码器结合,构建了支持可变时长和可变长度的 CLAP(对比语言-音频预训练)模型。
- 工程优化:作者对 OpenCLIP 主分支进行了大量修改,以支持可变分辨率和宽高比的编码器及相应的 webdataset 数据管线,并集成了现有的音频 CLAP 模型权重。
- 可用性:目前放出的多个模型版本(参数量从 160M 到 240M 不等)均可通过 OpenCLIP 主分支直接调用。
所属事件:OpenCLIP迎大更新,开源NaFlexCLAP多模态模型(2 条相关)→
「多模态」频道最新
- 英伟达携手 Runway:一天内将 Gen-4.5 引入 Vera Rubin 平台 — nvidia · 2026-08-14
- MiniMax Music 3 音乐模型已上线 ComfyUI — PurzBeats · 2026-08-14
- ComfyUI 实用节点推荐:更灵活的 Resize Image/Mask Alt — altoiddealer · 2026-08-14
- 实测 MiniMax Music 3.0:班卓琴清脆,乡村风格生成效果惊艳 — Nowawes · 2026-08-14
- LTX-2.5 视频生成实测:如何构建高效的多镜头提示词 — Interesting_Room2820 · 2026-08-14
- RTX 5090实测:SageAttention视频生成提速近2倍 — gabxav · 2026-08-14