Qwen3-VL 加 DeCoDe 在新视觉测试上升至 89.2%
HildeKuehne · x · 2026-07-29
Qwen3-VL 在多组新奇数据集上借助 DeCoDe 大幅提升
这条内容展示了一个视觉语言模型研究结果:作者在 6 个标准数据集 和 6 个新整理的 novel benchmarks 上做了评测,任务包括瑜伽动作、LEGO 积木、工业零件、埃及象形文字、昆虫和阿拉伯手语等。
在加入 domain information 后,Qwen3-VL + DeCoDe 的表现从 27.8% 提升到 89.2%,并且作者声称优于 SFT。
这说明当视觉语言模型面对陌生或强领域特定类别时,带领域信息的分解式提示/推理策略可能非常关键。
「研究」频道最新
- 简单遥操作录制加软顺应,已能完成不少机器人任务 — ihorbeaver · 2026-07-29
- 多项研究显示,AI терапия 回复常被评得比人类更有同理心 — sapinker · 2026-07-29
- TransluceAI 提出监督基础模型,专抓 reward hacking — JacobSteinhardt · 2026-07-29
- 为何 tokenizers 仍难被端到端优化 — seanmcdonaldxyz · 2026-07-29
- 学生用 molab 训练本地编码 agent,跑赢两款 7B 基线 — S_Conradi · 2026-07-29
- TILT 用模型内生奖励提升文生图组合一致性 — Debottam Dutta · 2026-07-29