NVIDIA开源3B视觉定位模型,号称比Qwen3-VL快10倍
Dan_Jeffries1 · x · 2026-09-30
NVIDIA 发布了一个 3B 参数的开源视觉语言模型,主打实时、高质量的视觉定位(visual grounding)。要点:
- 采用并行框解码(parallel box decoding),官方称速度比 Qwen3-VL 快 10 倍
- 训练数据规模:1.38 亿条查询、7.85 亿个框
- 支持 GUI 理解、OCR、文档版面分析与密集检测
- 定位场景包括 computer-use agent 和 Physical AI
模型已开源,适合需要快速定位屏幕元素或文档结构的 agent 类应用。
「编程与Agent」频道最新
- OpenAI DevDay 直播串:21 项更新,主角或是常驻在线 Agent — kimmonismus · 2026-09-30
- Apodex 1.1 发布:研究型 Agent 可中途改需求不重来 — SucceededMind · 2026-09-30
- 神经科学研究者用 Claude 与 GPT 当研究助理,产出了成果却愁没处发 — neuroecology · 2026-09-30
- 不给音频只给结构:Jev 零样本预测 2029 通电话,AUC 达 0.78 — alexcovo_eth · 2026-09-30
- Replicas V3 发布:VM 里跑 Claude Code 与 Codex,可自带订阅 — KlausCodes · 2026-09-30
- Agno 智能体框架支持将组件一等公民式发布为 MCP — pritisinghhhh · 2026-09-30