Roboflow 实测 GPT-6 Astra:检测 mAP@50 达 82.1%,为最强视觉模型
burny_tech · x · 2026-09-29
Roboflow 发布长文评测称 GPT-6 Astra 是其测试过的最强视觉模型。OpenAI 在 Astra 发布时重点面向 computer use 场景,而定位界面元素、读取文字等要求同时提升了计算机视觉能力。
核心数据:
- 在 Roboflow Vision Evals 的目标检测任务上,低推理档位下达 82.1% mAP@50,领先 Qwen3.8 Max 5.4 分、领先 GPT-5.6 Sol 13.7 分;其他模型即使开到高档推理也达不到这个分数。
- 在乐高分类示例中,能区分 4×1、4×2、3×2 等不同颜色、旋转和部分遮挡的积木,mAP@50 达 99.8%,兼顾小细节与类别语义理解。
- 基准外还测了 box prompting、分割、重识别与机器人控制。
实用意义: 作者认为 Astra 是大多数数据集自动标注的强力起点,产出的框常比人工标注更准,人工只需复核纠正少数错误(个别项目类型除外)。读者可在 Roboflow Playground 免费试用并用自己的图片对比其他模型。
「模型」频道最新
- 晒出 prompt 打脸:所谓模型自主攻击疑似人为诱导 — basedjensen · 2026-09-29
- OpenAI 界面现神秘「圆点」agents,疑为 Aeons 定制智能体进化版 — testingcatalog · 2026-09-29
- Duplex-MPE 基准测 AI 何时该开口:MiniCPM-o 4.5 三项领先 — PKU · 2026-09-29
- KAIST FlyBy 框架教小模型识别知识瓶颈,4B 以更低成本超 Qwen3-14B — kaist-ai · 2026-09-29
- 同一提示词做游戏:Sonnet 5.5 能跑,Opus 5.5 让人想一直玩下去 — victor_explore · 2026-09-29
- 真实举报数据打脸:Solar Decide 自定义基准仅57.8%,远逊 Jev 的83.3% — FlexDruk · 2026-09-29