giffmana 设想多模态 Jev:不到 1B 参数给任意图文打校准分

giffmana · x · 2026-10-01

著名视觉编码器研究者(giffmana)提出一个构想:一个多模态模型,输入任意图像和一组自由文本,为每条文本返回其与图像的匹配程度,还可通过在适当位置用 sigmoid 实现一组 yes/no 判断,且分数可校准。他称自己是视觉编码器的发明者之一,也深知其缺点,认为可以做到,可能需要融资 xxxM。更激进的目标是开源且参数量少于 1B(约 400M)。

所属事件:研究者畅想不到 1B 参数的多模态打分模型(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →