# 面壁智能发 MiniCPM-o 4.5 技术报告，12GB 消费显卡就能跑全双工音视频

> 原标题：消费级显卡可以快速上手跑！面壁智能MiniCPM-o 4.5发技术报告

- 来源：量子位 · 公众号
- 发布时间：2026-04-28T12:56:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11838
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247887537&idx=3&sn=c1a2b1c2e82579a31cf2d14d21a3d51e

## 摘要

面壁智能、OpenBMB、清华 NLP 和数学基础中心放出了 MiniCPM-o 4.5 的技术报告。模型参数约 90 亿，能同时处理视频、音频和文字流。核心设计叫 Omni-Flow，把不同信号放在一条统一时间线上分时复用，省掉了外挂的语音活动检测模块。报告里说，一张 12GB 显存的 RTX 5070 就能跑全双工模式，实时率做到 0.4，意味着生...

## 推荐理由

HKR 三项都成立：9B 全双工模型在 12GB 消费卡上跑到 RTF 0.4，靠 Omni-Flow 的时间轴对齐机制实现。不是前沿实验室的旗舰发布，但实用性强，78–84 分合理。

## 锐评

面壁智能放出了MiniCPM-o 4.5的技术报告，这是个约90亿参数的多模态模型，能同时处理视频、音频和文字。最值得关注的点是它把硬件门槛压得很低：一张RTX 5070（12GB显存）就能跑全双工模式，实时率做到0.4，意味着生成速度比实时播放还快，普通开发者不用租云GPU也能本地跑起来。

核心设计叫Omni-Flow，思路是把不同信号放在一条统一时间线上分时复用，省掉了外挂的语音活动检测模块。这比传统方案轻量，但报告里没展开说这种复用策略在嘈杂环境或多人对话场景下会不会翻车。另外，模型在视频理解上的具体表现、训练数据构成、以及和其他端侧多模态模型的横向对比，正文都没披露——因为微信页面被验证墙挡住了，实际内容看不到。

我会先打个折：硬件门槛低是真的，但技术报告的完整性和可复现性目前没法验证。等报告全文公开后，重点要看Omni-Flow在真实场景的延迟抖动和准确率衰减曲线，以及90亿参数在多任务上的天花板在哪。
