研究者畅想不到 1B 参数的多模态打分模型
知名视觉编码器研究者 giffmana 提出一个构想:打造一个不到 1B 参数的多模态模型,输入任意图像和一组自由文本,为每条文本返回其与图像的匹配程度评分,并可通过在适当位置使用 sigmoid 实现一组校准分数。另一位研究者 duchaaiki 在回复中将其戏称为「多模态版 Jevons」,双方就这一想法展开讨论。
2026-10-01 ~ 2026-10-01 · 2 条相关
- giffmana 设想多模态 Jev:不到 1B 参数给任意图文打校准分 — giffmana · 2026-10-01
- 先靠 softmax 活几年?研究者畅想「Jevons 但多模态」打分模型 — ducha_aiki · 2026-10-01