6月17日,据报道,京东团队即将开源视觉语言实时交互模型JoyAI-VL-Interaction。据一份在开源社区及海外AI技术圈广受关注的技术报告披露,该模型推动多模态大模型从传统的“一问一答”模式,迈入“实时流式交互”新阶段,更契合AI需持续在线的典型应用场景。报告针对监控预警、实时计数、实时翻译、时间感知、直播解说与引导、长程记忆六大任务场景,对JoyAI-VL-Interaction与豆包、Gemini的App内视频通话助手展开人工对比评测。在全部58个测试案例中,JoyAI-VL-Interaction对豆包的总体胜率达77.6%,对Gemini达87.9%;其中监控预警场景表现尤为突出,对两大基线模型均实现100%胜率。
消息称京东即将开源视觉语言实时交互模型
更新时间 2026-06-17来源 三言科技正文 320字阅读约 1分钟







