OpenCLIP 迎来大更新:整合音频模型与可变分辨率架构
wightmanr · x · 2026-08-14
作者过去几个月对 OpenCLIP 库进行了大量修改,重点支持了可变分辨率/宽高比的 NaFlexViT 编码器及相应的 WebDataset 数据管线,并整合了现有的音频 CLAP 模型。
此外,作者尝试将 NaFlex 与 CLAP 结合,基于 timm 的 NaFlexViT 添加了 mel patch embedder,无需重大架构更改即可实现音频处理的可变时间能力。同时还引入了类似 ModernBERT 的 'modern-text' 文本编码器。初步训练的小型模型已验证了该架构的可行性。
所属事件:OpenCLIP迎大更新,开源NaFlexCLAP多模态模型(2 条相关)→
「多模态」频道最新
- Customuse发布MCP工具:用自然语言在Claude中自动生成3D资产 — JaynitMakwana · 2026-08-14
- AI 虚拟化身:迷幻赛博风动漫音乐视频 — VIV-AF-D · 2026-08-14
- 用 MiniMax H3 与多工具为孩子们制作 10 分钟短片 — davekilljoy · 2026-08-14
- MiniMax 音乐模型获好评:用户称已退订 Suno — cointalkz · 2026-08-14
- MiniMax H3 生成视频实测:巨型海龟爬山与 4x 放大 — LionLikeMan · 2026-08-14
- ElevenMusic 推出免费音效库,支持 AI 生成声音素材 — lukeharries · 2026-08-14