研究员自述:做应用型多模态研究如何自建数据集与指标
mariyaivasileva · x · 2026-09-21
研究员 Mariya Ivasileva 回应"广度牺牲深度"的质疑,谈自己如何做一个应用型视觉-语言研究项目。
- 因为现成方案不存在,她自己采集构建数据集、定义并验证指标、提出自己的模型。
- 她认为不必在每个子问题上追求极深,目标是给出满足应用约束的完整方案。
- 她的路径是逐步拆解:如何理解抽象的视觉关系、如何表示、能否学到编码这些关系的 embedding、短板在哪、如何改进并提升计算效率。
「研究」频道最新
- Anvil 团队组合式形式化验证 Kubernetes 控制平面 — tianyin_xu · 2026-09-21
- Astra 范式:任意 3D/4D 先验皆可蒸馏进 VLM,赋能机器人 — mariyaivasileva · 2026-09-21
- ReCouPLe 用语言理由做几何约束,奖励模型分布偏移下精度提升1.5倍 — burny_tech · 2026-09-21
- kalomaze:两位同行撞上多模态墙后,他改观了「借 SSL 特征」一事 — kalomaze · 2026-09-21
- 仅两个腕部相机,机器人闭环空间理解演示惊艳 — ChongZzZhang · 2026-09-21
- DeepMind 天气模型直接吃原始卫星辐射数据,逐小时同化预报一体 — burny_tech · 2026-09-21