# 阿里达摩院放出 Ovis2.6-80B-A3B：总参数 800 亿，推理时只激活约 30 亿的多模态 MoE 模型

> 原标题：AIDC-AI/Ovis2.6-80B-A3B · Hugging Face

- 来源：r/LocalLLaMA
- 发布时间：2026-05-13T12:29:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/19841
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tby79g/aidcaiovis2680ba3b_hugging_face/

## 摘要

Ovis2.6 把语言模型底座换成了混合专家架构，总参数量堆到 800 亿，但推理时只叫醒大概 30 亿个参数，跑起来比较省算力。上下文窗口拉到 64K token，能处理的图片分辨率最高到 2880×2880，适合啃长文档、高信息密度的图表和扫描件。这次加了一个“边想边看图”的能力，推理过程中模型可以主动裁剪、旋转图片区域，在思维链里反复检查视觉细节...

## 推荐理由

我会先打个折：正文没给任何跑分、授权条款和实测结果，所以别急着下结论。亮点是 80B 总参数里只激活约 3B，推理成本可能压得很低，同时支持 64K 上下文和 2880×2880 大图输入，适合拿来做文档理解、高分辨率视觉问答这类吃上下文和细节的任务。MoE 结构意味着你可以用消费级硬件试试，但实际吞吐和显存占用还得自己测。这点先别太激动，等补上基准测试和开源协议再说。

## 锐评

这条更新最实在的点是成本控制：800 亿总参数，推理时只激活约 30 亿，意味着用一张消费级显卡大概就能跑起来，对本地部署很友好。64K token 上下文和 2880×2880 的图片分辨率，主要利好啃长文档、高密度图表和扫描件这类任务。新加的“边想边看图”挺有意思，模型在思维链里可以主动裁剪、旋转图片区域再检查，相当于把视觉从被动输入变成了主动认知工具，对复杂图表问答可能有明显提升。

不过正文没给出任何具体评测分数，也没提在哪些基准上测过、跟谁比、赢了输了。OCR 和文档理解说“进一步强化”，但强化了多少、样本怎么选的，一概没写。这点先别太激动，等看到跑分和实测案例再判断。另外，模型是开源了，但没提用了什么数据训练、有没有许可证限制，想商用的人得自己去翻 Hugging Face 页面确认。
