# 京东开源 JoyAI-VL-Interaction：一个会主动看视频、主动说话的模型

> 原标题：京东全栈开源JoyAI-VL-Interaction，从"一问一答"走向"边看边说"

- 来源：AI HOT 精选
- 发布时间：2026-06-23T06:04:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40040
- 原文：https://mp.weixin.qq.com/s/IY6XGp4k6VgD9ZPH6YprCA

## 摘要

京东放出了一个全栈开源的交互模型，能盯着视频流看，自己判断什么时候该开口说话。它不像传统模型那样一问一答，而是边看边说，碰到复杂任务还能甩给后台的 agent 去处理。在 58 个人的盲测里，对比豆包视频通话助手赢了 77.6%，对比 Gemini 赢了 87.9%，监控预警场景直接 100% 胜率。开源包里给了模型权重、交互数据集、训练方案和一套能直...

## 推荐理由

京东开源了一个能看视频流、自己决定什么时候说话的交互模型，盲测数据挺硬：对比豆包赢77.6%，对比Gemini赢87.9%，监控场景100%胜率。全栈开源给得比较实在，权重、数据、训练方案、部署代码都放出来了。没给更高分是因为京东在模型圈还不是一线实验室，社区实际采用率未知，但开源诚意和交互方式的差异化够得上featured。

## 锐评

京东把 JoyAI-VL-Interaction 全栈开源了，模型权重、训练数据、部署方案都给了，这点挺实在。它跟传统一问一答的模型不一样，能持续看视频流，自己判断画面里有没有值得说的事，比如老人摔倒、监控异常，然后主动开口。复杂任务还能甩给后台 agent 处理，相当于让模型进了业务流程干活。

盲测数据看着漂亮：58 个人里，对比豆包视频通话助手赢了 77.6%，对比 Gemini 赢了 87.9%，监控预警场景直接 100%。但 58 人的样本量太小，统计意义有限，这点先别太激动。正文没披露测试的具体场景分布、视频时长、难度分级，也没说豆包和 Gemini 用的是哪个版本、什么配置。如果是真的，在安防、养老、直播解说这些实时场景里确实省钱省人，但实际落地效果还得看更大规模、更多样场景的验证。
