# 联影智能开源了首个能看懂医疗视频的模型方案，还带了一个52万条数据的评测集

> 原标题：让大模型理解真实医疗视频，全球首个开源技术方案来了！

- 来源：机器之心 · 公众号
- 发布时间：2026-04-28T07:41:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11350
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651030763&idx=1&sn=9c3e8e595c0f07a91388a3bb94a271ab

## 摘要

联影智能放出了 uAI-NEXUS-MedVLM，一个专门让大模型理解超声、内窥镜这类医疗视频的开源方案，配套论文中了 CVPR 2026。他们同时发布了一个叫 MedVidBench 的评测集，包含 53.2 万条视频-指令对，覆盖 8 种医疗视频来源和 8 类任务。团队拿 Qwen2.5-VL-7B 在这个数据集上做监督微调，在核心指标 CVS 上...

## 推荐理由

HKR 三项都站得住：真实医疗视频加首个开源方案自带话题性，53 万条数据和 89.4% 对 16.4% 的结果提供了硬信息，也切中了通用模型在专业领域拉胯、开源方案抢位的行业情绪。医疗场景的垂直属性让分数落在 78–84 区间，82 分合理。

## 锐评

这条消息值得关注的点在于，它把医疗视频理解从“看图说话”推进到了“看视频做判断”。联影智能放出的uAI-NEXUS-MedVLM方案和MedVidBench评测集，覆盖了超声、内窥镜等8种动态影像，任务也从简单的识别延伸到手术阶段判断这类需要时序推理的活。

用Qwen2.5-VL-7B做监督微调后，核心指标CVS准确率达到89.4%，而GPT-5.4直接上的成绩只有16.4%。这个对比很直观地说明，通用大模型在专业动态影像面前基本是抓瞎的，领域数据和针对性训练必不可少。53.2万条视频-指令对的规模不算小，对想在这个方向做二次开发的人来说，数据本身可能比模型更有用。

不过正文没披露这套数据的人工标注成本和质量控制流程，也没提模型在不同设备、不同资历医生操作下的表现差异。医疗场景里，换个探头品牌或者操作手法，准确率会不会掉，这点目前还看不到验证。另外，方案虽然开源了，但论文刚中CVPR 2026，代码和权重的实际可用性还得等放出来再看。
