# 7B小模型在医学影像理解上跑赢o3和GPT-5，靠的是教会模型“看哪里、怎么看”

> 原标题：7B打败o3、GPT-5！医学AI智能体让模型学会“看哪里、怎么看”

- 来源：量子位 · 公众号
- 发布时间：2026-05-27T09:26:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/29695
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247893397&idx=3&sn=d86dba851c44d7cf9236b933d052be3f

## 摘要

上海创新研究院的LeapQuest和三所大学搞了两个医学AI系统Ophiuchus和MedScope，核心思路是让模型在看图看视频时学会像医生一样先定位关键区域再分析。Ophiuchus-7B在8个医学视觉问答基准上拿了68.0分，比OpenAI-o3的62.2、Gemini 2.5 Pro的61.8和GPT-5的59.9都高。正文没披露具体参数量以外...

## 推荐理由

我会先打个折：标题里 GPT-5 目前没公开评测数据，更像噱头，但 7B 模型在医学 VQA 上跑赢 o3 这个事实本身够抓人。正文给了 8 个 benchmark 的平均分对比，信息量撑得起 featured。不是通用大模型发布，分数定在 80 合理。

## 锐评

上海创新研究院的LeapQuest和三所大学搞了两个医学AI系统Ophiuchus和MedScope，核心思路是让模型在看图看视频时，先学会像医生一样定位关键区域再分析，而不是整张图乱扫。Ophiuchus-7B在8个医学视觉问答基准上拿了68.0分，比OpenAI-o3的62.2、Gemini 2.5 Pro的61.8和GPT-5的59.9都高。

这个分数差距挺明显，但正文没披露测试集是否公开、有没有做数据泄露检查。医学影像数据集经常存在训练集和测试集重叠的问题，如果没做严格隔离，小模型靠背题拿高分并不稀奇。另外，68分在百分制里也不算高，说明医学看图问答本身还是个硬骨头。

还缺几个关键信息：模型推理一次要多久、显存占用多少、能不能在普通医院设备上跑。如果延迟太高或者必须上高端显卡，临床落地就还远。
