# DeepSeek 放出了“用视觉原语思考”框架，让模型在推理时直接画坐标和框

> 原标题：DeepSeek released 'Thinking-with-Visual-Primitives' framework

- 来源：r/LocalLLaMA
- 发布时间：2026-04-30T13:43:54.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12221
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1szwi1d/deepseek_released_thinkingwithvisualprimitives/

## 摘要

DeepSeek 和北大、清华一起发了篇论文，还公开了代码库。这个框架的思路是在思维链里插入坐标点和边界框，相当于让模型边想边在图上做标记。帖子本身没贴跑分数据，正文也没披露具体指标，所以效果到底提升多少还不清楚。

## 推荐理由

我会先打个折，因为正文没披露任何 benchmark 分数，效果到底怎么样还不清楚。但亮点很实在：它让模型在推理时能指着图像说“看这里”，把坐标点和边界框当成思考的最小单元，这比纯文字描述直观得多。代码已经开源，对做多模态推理和可解释性的从业者来说，是个值得上手试的方向。没给分数就先别太激动，但思路本身够新，所以给到 80 分。

## 锐评

这篇论文的核心想法不复杂：以前多模态模型看图说话，要么直接出文字，要么在后台偷偷算位置。DeepSeek 这次把“在图上做标记”这件事直接塞进了思维链里，让模型边想边标出坐标点和边界框，相当于把视觉推理过程摊开给人看。合作方包括北大和清华，代码也开源了，这点值得肯定。

但 Reddit 帖子本身被屏蔽了，正文没披露任何基准测试的分数。没有准确率、没有对比基线，我们完全不知道这套方法在具体任务上能提升多少，也不知道计算开销会增加多少。我会先打个折：思路有意思，但效果还是个问号。

还缺什么？需要看到在文档理解、图表问答这类实际任务上的量化结果，以及推理延迟和显存占用的数据。另外，这种显式坐标标注对模糊、遮挡图片的鲁棒性如何，论文里也没提。
