# Liquid AI 开源 LFM2.5-VL-3B，一个能在本地跑的视觉语言模型，主打屏幕理解和工具调用

> 原标题：LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge

- 来源：Hugging Face 博客
- 发布时间：2026-08-12T14:00:51.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51135
- 原文：https://huggingface.co/blog/LiquidAI/lfm2-5-vl-3b

## 摘要

Liquid AI 放出了 LFM2.5-VL-3B，一个 30 亿参数的视觉语言模型，可以直接在你自己的电脑或手机上跑。它不搞长链条推理，直接给答案，适合需要实时响应的场景。这次主要升级了四个能力：能看懂各种设备的屏幕界面、用自然语言圈出图片里的物体、同时理解多张图片，以及大幅强化了工具调用（不管带不带图片都能用）。官方给了跑分对比和 CPU/GPU...

## 推荐理由

Liquid AI 发了一个30亿参数的视觉模型，主打本地推理和实时响应，给了四个明确的能力升级和跑分对比。H 和 K 都踩中了，但品牌号召力在视觉领域偏弱，R 没起来，分数刚好卡在 featured 门槛上。

## 锐评

Liquid AI 放出的 LFM2.5-VL-3B 是个 30 亿参数的视觉语言模型，明确不做长链条推理，直接给答案，目标就是能在你手机或电脑上本地跑起来。这次升级了四个点：能看懂屏幕界面、用自然语言在图片里圈物体、同时理解多张图，以及强化了工具调用能力。官方给了跑分对比，也提了 CPU/GPU 推理速度，但正文没给出具体的延迟数字，比如处理一张图到底要多少毫秒。这点先别太激动，没实测延迟就很难判断它在真实设备上到底卡不卡。另外，模型虽然开源了，但训练数据、偏好对齐的具体方法都没细说，只讲了能做什么，没讲怎么做的。如果你在找能塞进 App 里做 UI 识别或简单图片问答的小模型，这个可以试试，但落地前最好自己跑一遍延迟和准确率。
