OpenCLIP 下个版本将支持 CLAP、CoCa 等多种多模态架构
wightmanr · x · 2026-08-21
OpenCLIP 项目正在为下一个主要版本进行验证和清理工作,新版本将支持多种模型架构和目标:
- CLIP / SigLIP:图像+文本编码器,对比学习。
- CLAP:音频+文本编码器,对比学习。
- CoCa(2):图像编码器 + 文本编码器 + 交叉注意力文本解码器,结合对比学习和字幕 CE 损失。
- MaMMUT(2):图像编码器 + 单个文本解码器运行两次(对比通过 + 字幕通过)。
- GenLIP / GenLAP:无独立编码器,单主干网络处理 [图像|音频 ; 文本],仅前缀 LM 字幕 CE 损失。
以上所有架构均可与 NaFlex 原生纵横比 ViT、现代文本塔以及融合字幕 CE + z-loss 组合使用。
所属事件:OpenCLIP 新版本将支持多种多模态架构(2 条相关)→
「研究」频道最新
- RAG vs CAG:利用 KV 缓存实现 90% 成本削减 — blaizedsouza · 2026-08-21
- Arc Institute 启动 2026 虚拟细胞挑战赛 — AllThingsApx · 2026-08-21
- 观点:从完整 LLM 逐层剥离或能找到更优架构权衡 — antoine_chaffin · 2026-08-21
- Hawkeye 框架:让编程 Agent 懂硬件优化 — Moh1tAgarwal · 2026-08-21
- 研究员吐槽:大量 AI 生成的晦涩论文充斥审稿 — TuhinChakr · 2026-08-21
- 安全围栏导致 LLM 文风易被识别 — The Decoder · 2026-08-21