Qwen3-VL 加 DeCoDe 在新视觉测试上升至 89.2%

HildeKuehne · x · 2026-07-29

Qwen3-VL 在多组新奇数据集上借助 DeCoDe 大幅提升

这条内容展示了一个视觉语言模型研究结果:作者在 6 个标准数据集 和 6 个新整理的 novel benchmarks 上做了评测,任务包括瑜伽动作、LEGO 积木、工业零件、埃及象形文字、昆虫和阿拉伯手语等。

在加入 domain information 后,Qwen3-VL + DeCoDe 的表现从 27.8% 提升到 89.2%,并且作者声称优于 SFT。

这说明当视觉语言模型面对陌生或强领域特定类别时,带领域信息的分解式提示/推理策略可能非常关键。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →