giffmana 设想多模态 Jev:不到 1B 参数给任意图文打校准分
giffmana · x · 2026-10-01
著名视觉编码器研究者(giffmana)提出一个构想:一个多模态模型,输入任意图像和一组自由文本,为每条文本返回其与图像的匹配程度,还可通过在适当位置用 sigmoid 实现一组 yes/no 判断,且分数可校准。他称自己是视觉编码器的发明者之一,也深知其缺点,认为可以做到,可能需要融资 xxxM。更激进的目标是开源且参数量少于 1B(约 400M)。
所属事件:研究者畅想不到 1B 参数的多模态打分模型(2 条相关)→
「模型」频道最新
- 蚂蚁 Ling-3.1-flash:560B 总参 25B 激活,即将开源 — _AndrewZhao · 2026-10-01
- Grok 4.8 现身 xAI 官方仓库,发布准备中或还需一两周 — mark_k · 2026-10-01
- 27B 模型 Q5 量化+131k 上下文塞进单张 24GB 3090,提速 13-17% — bjivanovich · 2026-10-01
- Bindu Redddy 实测 Sol 6.1:定时任务强、数据分析出色、性价比高 — bindureddy · 2026-10-01
- OpenCode 免费 Space Bunny 隐身模型日发万亿 token,实测可驱动 Blender 动画 — sidahuj · 2026-10-01
- Claude 挑战黎曼猜想,作者复盘它到底做了什么 — elsleightholm · 2026-10-01