# NuExtract3 发布：一个 4B 开源视觉模型，能把图片和文字转成 Markdown、做 OCR 和按模板抽信息，自己电脑就能跑

> 原标题：NuExtract3 released: open-weight 4B VLM for Markdown, OCR and structured extraction (self-hostable)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-25T13:14:58.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/27005
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tn8utn/nuextract3_released_openweight_4b_vlm_for/

## 摘要

Numind 放出了 NuExtract3，一个基于 Qwen3.5-4B 的开源视觉语言模型，用 Apache-2.0 协议。它主要干三件事：把图片或文字转成 Markdown 格式、从图片里直接识别文字（OCR）、以及按你给的 JSON 模板把非结构化内容抽成结构化数据。模型只有 4B 参数，对硬件要求不高，官方说最低 4GB 显存就能在本地部署。...

## 推荐理由

NuExtract3 把一个 4B 大小的开源视觉模型打包成了文档抽取工具，支持 OCR、转 Markdown 和按你给的 JSON 模板把内容抽出来。最吸引人的是它最低只要 4GB 显存就能在自己机器上跑，这对在意数据不出本地的团队来说省了不少事。模型基于 Qwen3.5-4B，用 Apache-2.0 协议，没有授权上的坑。不过正文没给出具体的抽取准确率或延迟数据，实际效果得自己测一下才知道。

## 锐评

NuExtract3 是个基于 Qwen3.5-4B 的开源视觉模型，主打三件事：图片转 Markdown、OCR 文字识别、按你给的 JSON 模板把非结构化内容抽成结构化数据。4B 参数意味着硬件门槛很低，官方说最低 4GB 显存就能在本地部署，这对个人开发者或小团队来说挺友好。权重以 Safetensors、GGUF 和 MLX 格式发布，覆盖了主流推理框架。

但这条消息有个硬伤：Reddit 原文被网络屏蔽，我们拿到的只是标题和摘要，缺少模型实际表现、定价细节和官方公告链接。46 个赞和 45 条评论说明社区关注度不低，但讨论内容我们看不到，没法判断用户反馈是正面还是翻车。

目前缺的东西很明确：官方技术报告或博客链接、与上一代或同类模型（如 MinerU、OmniParser）的对比数据、以及实际抽取准确率的 benchmark。在官方放出完整公告前，这条新闻只能当个信号看——方向对，但细节全盲。
