伯克利发布 CoVA-SFT 视觉推理链数据集
UCBerkeley · hf · 2026-09-02
UC Berkeley 发布了 CoVA-SFT,这是一个大规模多模态推理数据集。它旨在教语言模型通过结构化的推理步骤交错文本和视觉抽象,从而提升在视觉推理基准上的表现。
「多模态」频道最新
- 零素材构建人脑认知模型,AI 实时推理听觉处理 — mikeyk · 2026-09-02
- AI 制作饮料广告:眼球倒影与冷水飞溅特效 — anthara_ai · 2026-09-02
- MiniMax H3 提示词:布光织物片头效果 — umesh_ai · 2026-09-02
- 网友更关注 Meta 实时语音转录模型而非 Fable 5.1 — IndraVahan · 2026-09-02
- Fable 5.1 代码生成视频演示:从地块到建筑漫游 — alexalbert__ · 2026-09-02
- 李飞飞谈世界模型:这是与语言模型根本不同的问题 — drfeifei · 2026-09-02