京东在 JDD 上甩出可交互视听世界模型:EchoWM 开源,长视频生成同步冲到 10 分钟以上
打破10分钟极限!京东开源EchoWM,重塑可交互视听世界模型
jd-echowm-interactive-world-model
在9月9日的京东全球科技探索者大会(JDD)上,京东探索研究院抛出了一系列重磅技术底牌。其中,JoyAI-Echo系列的两大全新进展尤为吸睛:超长音视频生成模型升级至JoyAI-Echo1.5,同时发布并开源了可交互视听世界模型EchoWM。这两项突破标志着AI内容生成正式从“被动观看”向“主动探索”的全新维度进化。
长视频不再“失忆”:JoyAI-Echo1.5跨越10分钟门槛
在长视频生成赛道,保持长时间的内容一致性一直是个技术难点。JoyAI-Echo1.5给出的解法是“音视频Memory Bank”架构。得益于这一设计,模型在多镜头、长时程的生成过程中,能够牢牢锁定人物形象、声音特征和故事主线不跑偏,成功将音视频持续产出时间拉过10分钟大关。
更令人惊艳的是其推理效率。通过长视频后训练,JoyAI-Echo1.5的推理速度最高提升了7.5倍。只需2张H200显卡,就能在480P分辨率下实现平均每秒24帧的1:1等时生成。此外,内置的“Director Agent”能听懂自然语言指令,包揽故事展开、分镜规划、生成审核和成片组装这一整套导演工作流。
开源EchoWM:让视听世界真正“可交互”
现有的世界模型往往存在短板:能跟着用户操作生成画面的,通常缺乏自然声音;能联合生成音视频的,又难以让用户持续深入干预。京东此次开源的EchoWM,则巧妙地将这两大能力合二为一。
EchoWM能够原生联合生成720P视频、环境音、音乐和语音,并确保声音随场景、摄像机和主体运动同步动态变化。通过统一的“相机意图”控制机制,该模型同时支持第一人称导航、第三人称摄像机与主体协同控制,以及多轮连续探索。在实际的WBench Navigation评测中,EchoWM及其四步因果流式版本EchoWM-Flash包揽了前两名,其中EchoWM更是在涵盖158个多轮导航案例的榜单上夺得综合第一。
底座升级与产业落地:AI从数字走向物理世界
除了上述突破,京东还在此次大会上集中展示了JoyAI基础模型矩阵,将其能力从单纯的内容生成,延伸至动态环境的感知、模拟与交互。现场还预告了新一代音视频基础模型JoyAI-Video,其重点强化了商业视频生成、物理规律呈现、第一人称视角和多镜头连续叙事,瞄准电商广告、短剧创作和具身智能演练,计划于10月正式发布。
在数据与基础设施层面,EgoLive真实数据、JoyAI-Sim仿真转换工具链等配套体系也同步亮相,搭建起从真实数据、仿真转换到模型研发的完整支撑闭环。
在产业落地方面,京东将AI触角全面伸向零售、物流、医疗、工业、政务五大行业。从零售多模态模型的图搜与导购,到物流超脑3.0基于Agentic框架串联决策与物理执行;从京医千询3.0强化的医疗影像分析与模拟问诊,到工业大模型切入CAD设计,再到政务大模型的数据分析服务。基础模型创新与产业AI实践的双线并进,构成了京东将AI能力从数字世界推向物理世界的宏大布局。