实测 Qwen3.8-Max 多模态能力:精准提取图像边界框
lateinteraction · x · 2026-08-06
开发者 Kevin Madura 撰文测试了 Qwen3.8-Max 模型的图像定位能力。实验跳过了常规的视觉问答,直接要求模型返回结构化的 JSON 格式边界框坐标,并通过 Python 和 Pillow 将检测结果绘制回原图。
实验过程揭示了几个关键技巧:首先必须将图像的真实尺寸(如 3403×5104)告知模型,否则会导致坐标错位;在正确提示下,模型成功在拥挤场景中识别出 64 辆汽车,边界框对齐精准。此外,测试还拓展到了橄榄球比赛画面,要求模型按球员角色进行分类并读取球衣号码,展示了多模态模型在复杂体育分析中的潜力。
「模型」频道最新
- 数学图表推理测试:最强模型得分不足 50% — prof_g · 2026-08-06
- Ethan Mollick:大模型指令遵循能力增强,但开始拥有“自主判断” — emollick · 2026-08-06
- 大模型初周性能最强?开发者呼吁建立模型验证标准 — sull · 2026-08-06
- 预测市场看好Anthropic:2026年AI霸主概率达69% — Polymarket · 2026-08-06
- DeepSeek 试错加 Opus 兜底:开发者分享 AI 编程模型组合技 — gandamu_ml · 2026-08-06
- Palantir 实测:NVIDIA 原版模型 24 小时即超越前沿大模型 — eliano · 2026-08-06