# 给 DeepSeek V4 接一个 3B 的视觉前端，今天就能跑

> 原标题：给性价比最高的推理引擎装一双眼睛

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-15T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50982
- 原文：https://yage.ai/share/deepseek-vision-workaround-20260815.html

## 摘要

DeepSeek V4 的 API 不收图片，但 Liquid AI 新出的 LFM2.5-VL-3B 可以当它的眼睛。作者在自家车库摄像头上零样本测了一把，判断门开没开准确率 94.3%，本地跑完只要 1.5 秒。图片不出设备，只有“门开了”这类文字结果上云做推理。这套感知和推理分开的架构，在延迟、隐私和成本上的优势，就算 DeepSeek 以后自己...

## 推荐理由

作者用 Liquid 的 LFM2.5-VL-3B 给 DeepSeek V4 搭了一个感知前端，在真实车库摄像头上测出 94.3% 准确率和 1.5 秒延迟，数据具体、架构清晰。文章还顺带梳理了 DeepSeek 在视觉上的研究脉络（VL2、被撤回的 Thinking with Vision 等），把“为什么现在需要外挂眼睛”这件事讲透了。我会先打个折：测试场景只有一个车库门，泛化到什么程度正文没展开，这点先别太激动。但整体上，这套感知和推理分离的做法在成本、隐私和延迟上的优势是实打实的，对正在找 DeepSeek 视觉替代方案的开发者来说，是一...

## 锐评

这篇文章讲了一个很实际的工程思路：把视觉感知和逻辑推理拆成两层，用小模型在本地看图说话，大模型在云端做判断。作者用Liquid AI刚发的LFM2.5-VL-3B在自家车库摄像头上实测，零样本判断门开没开准确率94.3%，本地跑完只要1.5秒。这个数字挺扎实，但要注意两点：一是验证集只有280张图，规模偏小；二是任务换成多类别检测时recall掉到66.2%，空场景误报率47%，说明零样本小模型目前只适合做简单的二选一判断，复杂场景还撑不住。

文章把分离架构的优势讲得很清楚：本地感知1.5秒，云端推理3到5秒，这个延迟差是光速和网络决定的，DeepSeek就算明天出多模态也抹不掉。图片不出设备的隐私属性、高频感知零成本的本地推理，这些优势也不会因为API降价就消失。但作者也诚实指出一个关键缺口：小模型输出的是自然语言，不是概率分数，怎么从"门开了"这种文字里提取可靠的置信度信号来决定要不要升级到云端推理，正文没给出校准方法，这是从概念到生产要补的环节。

整体判断有实测数据支撑，不是纯概念推演。但LFM2.5-VL-3B的性能数据全部来自厂商自评，目前没有独立复现，这点先别太激动。
