跳到正文
r/LocalLLaMA

阿里达摩院放出 Ovis2.6-80B-A3B:总参数 800 亿,推理时只激活约 30 亿的多模态 MoE 模型

AIDC-AI/Ovis2.6-80B-A3B · Hugging Face

Ovis2.6 把语言模型底座换成了混合专家架构,总参数量堆到 800 亿,但推理时只叫醒大概 30 亿个参数,跑起来比较省算力。上下文窗口拉到 64K token,能处理的图片分辨率最高到 2880×2880,适合啃长文档、高信息密度的图表和扫描件。这次加了一个“边想边看图”的能力,推理过程中模型可以主动裁剪、旋转图片区域,在思维链里反复检查视觉细节...

推荐理由:我会先打个折:正文没给任何跑分、授权条款和实测结果,所以别急着下结论。亮点是 80B 总参数里只激活约 3B,推理成本可能压得很低,同时支持 64K 上下文和 2880×2880 大图输入,适合拿来做文档理解、高分辨率视觉问答这类吃上下文和细节的任务。MoE 结构意味着你可以用消费级硬件试试,但实际吞吐和显存占用还得自己测。这点先别太激动,等补上基准测试和开源协议再说。

读原文 ↗导出 Markdown