实测 Qwen3.8-Max 多模态能力:精准提取图像边界框

lateinteraction · x · 2026-08-06

开发者 Kevin Madura 撰文测试了 Qwen3.8-Max 模型的图像定位能力。实验跳过了常规的视觉问答,直接要求模型返回结构化的 JSON 格式边界框坐标,并通过 Python 和 Pillow 将检测结果绘制回原图。

实验过程揭示了几个关键技巧:首先必须将图像的真实尺寸(如 3403×5104)告知模型,否则会导致坐标错位;在正确提示下,模型成功在拥挤场景中识别出 64 辆汽车,边界框对齐精准。此外,测试还拓展到了橄榄球比赛画面,要求模型按球员角色进行分类并读取球衣号码,展示了多模态模型在复杂体育分析中的潜力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →