# 英伟达 LocateAnything：用并行框解码做视觉定位，号称比 Qwen3-VL 快 10 倍

> 原标题：Nvidia LocateAnything - Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding. (10x faster than Qwen3-VL)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-28T06:43:46.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/29467
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tpvldv/nvidia_locateanything_fast_and_highquality/

## 摘要

英伟达放出了一个叫 LocateAnything-3B 的模型，专门做视觉语言定位——就是给张图、说句话，模型把对应物体用框标出来。它主打“并行框解码”，不像传统方法一个个框串行生成，所以速度上来了，标题直接写比 Qwen3-VL 快 10 倍。不过帖子正文只给了 Hugging Face、GitHub、Demo 和项目链接，没披露具体跑分设置和准确率...

## 推荐理由

我会先打个折：正文基本就是标题加三个链接，没有完整评测设置，也没给召回率、准确率这些质量指标，所以“快 10 倍”目前只能当官方说法看。但 Nvidia 开源一个 3B 的视觉定位模型，用并行框解码把速度拉起来，这件事本身对做实时视频分析、端侧部署的人挺实用。先放进 featured，等有第三方跑分再更新判断。

## 锐评

Nvidia 放出的 LocateAnything-3B 是个 3B 参数的小模型，专门干一件事：你给张图，再用话说“把那个红色的杯子框出来”，它就直接在图上标框。它跟传统方法最大的区别是“并行框解码”——以前这类模型是一个框一个框串行生成，像打字一样慢；它是所有框同时出，所以标题敢写比 Qwen3-VL 快 10 倍。

不过这条帖子本身信息量很薄，只给了 Hugging Face、GitHub 和 Demo 链接，正文没披露具体测试环境、图片分辨率、框的数量上限，也没提准确率对比。速度快 10 倍是在什么条件下测的、定位精度有没有打折，这些关键数字全缺。项目页和论文里可能有，但光看这条帖子没法下判断。

对做端侧或实时视频分析的人来说，3B 这个尺寸很友好，如果能跑在 Jetson 上，成本会很低。但实际能不能用，还得看它在复杂场景下的召回和误检率。建议直接去跑 Demo，别只看标题里的 10x。
