京东开源 JoyAI-VL-Interaction:一个会主动看视频、主动说话的模型
京东全栈开源JoyAI-VL-Interaction,从"一问一答"走向"边看边说"
京东放出了一个全栈开源的交互模型,能盯着视频流看,自己判断什么时候该开口说话。它不像传统模型那样一问一答,而是边看边说,碰到复杂任务还能甩给后台的 agent 去处理。在 58 个人的盲测里,对比豆包视频通话助手赢了 77.6%,对比 Gemini 赢了 87.9%,监控预警场景直接 100% 胜率。开源包里给了模型权重、交互数据集、训练方案和一套能直...
推荐理由:京东开源了一个能看视频流、自己决定什么时候说话的交互模型,盲测数据挺硬:对比豆包赢77.6%,对比Gemini赢87.9%,监控场景100%胜率。全栈开源给得比较实在,权重、数据、训练方案、部署代码都放出来了。没给更高分是因为京东在模型圈还不是一线实验室,社区实际采用率未知,但开源诚意和交互方式的差异化够得上featured。