文 | 京比特
安防摄像头拍到了异常画面,但它只会录下来,等人回看。
独居老人在家摔倒,监控把画面存进硬盘,等子女发现了再翻记录。
视障人士走在陌生街道,AI眼镜沉默不语,等他按下拍照键才告诉他“你面前是一堵墙”。
这不是AI不够聪明,是AI不在场。
当前,绝大多数大模型的能力边界是“离线智能”——你传一张图,它回答这是什么;你发一段视频,它总结发生了什么。任务完成,AI下线。但真实世界不等人。火灾不会等你上传画面,摔倒的老人不会等你按下拍照键,盲人面前的障碍物不会等你先问一句“这是什么”。
京东刚刚开源了一个模型,正在改变这件事。
6月22日,京东正式发布JoyAI-VL-Interaction——全球首个全栈开源的实时视频视觉语言交互模型,获得vLLM-Omni的day-0原生支持。这不是一个“更强的问答模型”,而是一个“能在场、会判断、懂沉默”的实时助手。京东给AI装上了眼睛和判断力——让大模型从“一问一答”走向“边看边说”。
一、AI的“在场”能力,为什么比“聪明”更重要
今天的大模型在图文问答、视频总结、内容分析等任务上已经足够好用。你上传一段工厂流水线的视频,问“这个环节有没有异常”,它能答得头头是道。但当你把它放进真实世界——监控预警、实时翻译、手术辅助、老年看护——你会发现它“笨”得令人着急。
因为它永远在等你先开口。
主流AI的工作模式是“回合制”:用户发起→模型响应→用户再发起→模型再响应。每一个判断周期里,都夹着一个“等人提问”的空窗期。在真实世界里,这个空窗期可能就是一场事故。
JoyAI-VL-Interaction做了一件看似简单但极少有人做到的事:它学会了自己判断“什么时候该开口,什么时候该闭嘴”。
三重能力,指向同一件事——“在场”。
第一,主动判断,不靠唤醒。 传统模型靠用户提问触发,JoyAI-VL-Interaction靠持续观察触发。用户设置“裁判出示红牌时提醒我”,模型就守着直播画面,红牌一出立刻预警。不用等用户再问一句“刚才发生了什么”。
第二,实时响应,不等事后。 传统视频理解要等完整视频上传后才能分析。JoyAI-VL-Interaction面向实时视频流,画面变化的瞬间就能响应。晚两秒,安防预警可能就是两种结局。
第三,协同委托,不失焦点。 遇到复杂任务——比如生成代码、调用工具、深度推理——JoyAI-VL-Interaction可以交给后台大模型或Agent处理。前台模型继续观察现场,后台处理完后自然接回对话。一套“前台在岗+后台干活”的协同体系。
会说话很重要,会沉默同样重要。JoyAI-VL-Interaction每秒做一次判断:继续观察、保持沉默,还是主动回应。这是模型自己学会的能力,不依赖外部规则。
它不是更聪明的AI,是更在线的AI。
二、参数竞赛的尽头,是场景竞赛
2026年的AI行业有一个心照不宣的焦虑:参数越堆越大,但用户感知到的“智能”却没有同比提升。跑分领先的模型,在真实场景里未必比得上一个“不聪明但永远在线”的助手。
京东的差异化恰好不在参数,在场景。
评测数据说明了这一点。在58个真人盲评案例中,覆盖监控预警、实时计数、实时翻译、直播解说等真实流式场景,JoyAI-VL-Interaction对比豆包视频通话助手,总体胜率77.6%;对比Gemini视频通话助手,总体胜率87.9%。尤其在监控预警场景中,对两个基线均取得100%胜率。
这不是算力的胜利,是“对真实场景的理解”的胜利。
京东的护城河恰恰在这里。深耕零售、物流、健康、工业二十余年,京东拥有覆盖仓储、配送、门店、直播、客服、售后海量真实场景的“物理世界运营网络”。这些场景每天都在发生人、货、场的实时互动。对AI而言,这不是抽象数据,而是进入物理世界的天然训练场。
这解释了为什么京东有能力做“在场AI”——因为它有场景。一个从来不做零售、没有仓库、不碰物流的AI公司,代码写得再好,也不知道“仓库里什么样的异常值得预警”“配送路上什么样的画面该被关注”“直播间里什么样的互动需要实时回应”。这些知识写在代码里,长在场景里。
京东2026年Q1财报明确提出“AI驱动建设全球最大物理世界运营中心”,2026年京东体系AI相关研发投入增长将超200%,计划两年内积累1000万小时真实场景视频数据。JoyAI-VL-Interaction不是实验室里的技术演示,是从真实场景里长出来的能力。
三、开源不是捐代码,是在定义赛道
JoyAI-VL-Interaction的另一个标签值得关注:“全栈开源”。
很多开源模型只提供基础推理能力。开发者要真正用起来,还需要自己解决视频接入、语音交互、记忆模块、前后端协同等一系列工程问题。JoyAI-VL-Interaction开源的是完整技术栈——模型权重、交互数据集、训练方案和可部署系统。
这意味着什么?意味着一个开发者可以在几小时内搭建一套能“持续观察、自主判断、即时响应”的实景AI原型,而不是花几个月从零开始处理视频流、语音接口、前后端调度。监控预警、老人看护、直播讲解、AI眼镜、无障碍辅助——这些以往需要专门团队投入大量人力的应用,门槛被大幅降低。
更关键的是,JoyAI-VL-Interaction获得了vLLM-Omni的day-0原生支持,已合入vLLM-Omni主线。vLLM是全球最流行的大模型推理框架之一,这标志着京东的“实时交互AI”方案已进入全球主流AI工程社区。
京东不是在捐一个模型,是在定义一个赛道——“实时视频交互AI”的技术框架和工程标准。当越来越多开发者基于这套框架构建物理世界AI应用,京东在“AI在场”这个方向上的生态话语权将不可逆地建立起来。
结语:AI的下一个战场,不在云端,在物理世界
从“一问一答”到“边看边记边回应”,从离线视频理解到实时流式交互,从屏幕里的AI到物理世界里的AI——京东用JoyAI-VL-Interaction证明了另一条路的可行性。
真正的智能,不是能回答多难的问题,而是能在关键时刻“在场”。
京东的差异化不在算力,在场景。二十余年实体产业的积累,让京东拥有全球最丰富的物理世界场景——这不是技术堆出来的,是一步一步跑出来的。从“看懂”到“看懂+响应”,从“一问一答”到“边看边说”——AI正在从数字世界走向物理世界。而率先完成这个跨越的,可能不是参数最大的公司,而是场景最深的公司。
不拼参数拼场景——这不仅是京东的AI方法论,也可能是AI下一阶段竞争的底层逻辑。
红包分享
钱包管理

