给 DeepSeek V4 接一个 3B 的视觉前端,今天就能跑
给性价比最高的推理引擎装一双眼睛
DeepSeek V4 的 API 不收图片,但 Liquid AI 新出的 LFM2.5-VL-3B 可以当它的眼睛。作者在自家车库摄像头上零样本测了一把,判断门开没开准确率 94.3%,本地跑完只要 1.5 秒。图片不出设备,只有“门开了”这类文字结果上云做推理。这套感知和推理分开的架构,在延迟、隐私和成本上的优势,就算 DeepSeek 以后自己...
推荐理由:作者用 Liquid 的 LFM2.5-VL-3B 给 DeepSeek V4 搭了一个感知前端,在真实车库摄像头上测出 94.3% 准确率和 1.5 秒延迟,数据具体、架构清晰。文章还顺带梳理了 DeepSeek 在视觉上的研究脉络(VL2、被撤回的 Thinking with Vision 等),把“为什么现在需要外挂眼睛”这件事讲透了。我会先打个折:测试场景只有一个车库门,泛化到什么程度正文没展开,这点先别太激动。但整体上,这套感知和推理分离的做法在成本、隐私和延迟上的优势是实打实的,对正在找 DeepSeek 视觉替代方案的开发者来说,是一...