NVIDIA 推出 LocateAnything,并行解码让视觉定位快至 12.7 框/秒
thisguyknowsai · x · 2026-09-10
- 核心问题:现有 VLM 把边界框拆成 4 个坐标 token(x1,y1,x2,y2)逐个顺序生成,这是 grounding 模型慢的根本原因,几何信息被拆散成一维 token。
- 方案:NVIDIA 发布 LocateAnything,采用 Parallel Box Decoding——把整个框当作原子单元,单次前向传播预测全部 4 个坐标。
- 架构:基于 Moon-ViT 视觉编码器 + Qwen2.5 解码器;提供 Fast Mode 提速,以及遇格式异常或空间歧义时自动回退的 Slow Mode,兼顾速度与可靠性。
- 性能:单张 H100 上达到每秒 12.7 个框的检测速度。
「模型」频道最新
- DeepSeek 用 LLM 设计算法,分布式 RSI 已在发生 — teortaxesTex · 2026-09-10
- 实测称 DeepSeek V4.1 Flash 运动视频接近 Opus 水准 — mesmerlord · 2026-09-10
- Google 上一次 Pro 级模型发布还要追溯到今年 2 月 — ChrisGPT · 2026-09-10
- Anthropic 模型被曝极端偏向先验信息,动机性推理再添证据 — asusarla · 2026-09-10
- 「以 1.4% 成本拿到 Astra 98% 的分数」,新模型成本曲线引热议 — pstAsiatech · 2026-09-10
- 曝光:头部实验室 TOS 只保护用户可见内容,思维链被拿去造合成数据 — erikphoel · 2026-09-10