OpenCLIP 下个版本将支持多架构
wightmanr · x · 2026-08-21
OpenCLIP 即将发布的下一个主要版本将支持多种模型架构,包括:
- CLIP / SigLIP:图像+文本编码器,对比学习。
- CLAP:音频+文本编码器,对比学习。
- CoCa:图像编码器+文本编码器+交叉注意力文本解码器,结合对比学习与标题交叉熵损失。
- MaMMUT:图像编码器+运行两次的文本解码器(分别进行对比学习与标题生成)。
- GenLIP / GenLAP:无独立编码器,单主干处理 [图像|音频 ; 文本],仅使用 Prefix-LM 标题 CE 损失。
所有上述架构均可与 NaFlex 原生纵横比 ViT、现代文本塔以及融合的标题 CE + z-loss 组合使用。
所属事件:OpenCLIP 新版本将支持多种多模态架构(2 条相关)→
「Infra」频道最新
- 2026 Q2 CPU 市场强劲增长,服务器端激增 20% — firstadopter · 2026-08-21
- GitHub 宕机近 8 小时,官方披露扩容失败根因 — mariorod1 · 2026-08-21
- DecagonAI 将实时 TTS 首音频延迟降至 30ms — dhruv2038 · 2026-08-21
- 美工会警告:新英格兰数据中心禁令或致数千人失业 — Polymarket · 2026-08-21
- Waymo 硬件成本降至 2 万美元,特斯拉欲将 Cybercab 总成本压低 — JOBhakdi · 2026-08-21
- Cursor 揭秘 Git 存储新架构:S3 即真源,本地仅缓存 — xennygrimmato_ · 2026-08-21