OpenCLIP 迎来大更新:整合音频模型与可变分辨率架构

wightmanr · x · 2026-08-14

作者过去几个月对 OpenCLIP 库进行了大量修改,重点支持了可变分辨率/宽高比的 NaFlexViT 编码器及相应的 WebDataset 数据管线,并整合了现有的音频 CLAP 模型。

此外,作者尝试将 NaFlex 与 CLAP 结合,基于 timm 的 NaFlexViT 添加了 mel patch embedder,无需重大架构更改即可实现音频处理的可变时间能力。同时还引入了类似 ModernBERT 的 'modern-text' 文本编码器。初步训练的小型模型已验证了该架构的可行性。

所属事件:OpenCLIP迎大更新,开源NaFlexCLAP多模态模型(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →