边看边改不卡顿!京东开源30帧流式视频编辑模型,跨界赋能具身智能
告别“先拍后剪”:实时互动重塑创作流
在传统的视频制作流程中,“先拍摄素材,再后期剪辑”几乎是不可打破的铁律。然而,京东最近开源的一款自研模型正在颠覆这一认知。这款名为 JoyAI-Video-Edit 的实时流式视频编辑模型,让创作者能够像玩即时战略游戏一样,一边播放视频一边对人物和场景进行“动刀”。从“后期精雕细琢”到“实时互动创作”,视频编辑的玩法正在被重新定义。
突破物理极限:30帧秒级推理与无限时长
要实现“边看边改”,首要跨越的鸿沟就是处理速度。如果 AI 的运算跟不上视频的播放帧率,画面就会陷入无尽的卡顿。依托全自研的 JoyAI-Video 底座,JoyAI-Video-Edit 在 720P 高清分辨率下,硬生生将模型推理速度拉升至每秒 30 帧。这意味着它不仅能保持画面的细腻清晰,还能完美契合主流影视内容的播放节奏,彻底告别延迟焦虑。
此外,过去的流式编辑工具往往只能处理几秒钟或几分钟的短片,而 JoyAI-Video-Edit 彻底打破了时长枷锁。它支持任意长度的稳定流式处理,视频播到哪,AI 就处理到哪。创作者无需苦等整片渲染,在播放过程中就能随心替换物体、调整人物造型或切换画面风格。
霸榜权威评测,四大核心任务表现惊艳
是骡子是马,拉出来遛遛。研究团队将 JoyAI-Video-Edit 与 SANA Streaming、LiveEdit 以及 Xmax-X2.0 等国际主流流式视频编辑模型进行了正面对比。结果令人振奋:在覆盖各类典型场景的测试中,该模型各项指标均实现了全面领跑。
特别是在业界公认的 OpenVE-Bench 通用评测中,JoyAI-Video-Edit 更是力压群雄,登顶现有流式编辑方法的榜首。它在全局风格转换、局部元素替换、局部内容删除以及字幕编辑这四大核心任务中展现出了压倒性优势。
落实到具体应用中,它的表现同样亮眼:你可以让视频主角在走动中无缝切换多套服装;在户外直播时,一键将平凡的街道瞬间转化为二次元动画世界;或者在家装设计展示中,实时预览不同家具、墙面材质和灯光搭配的最终效果。
跨界破圈:化身具身智能的“数据制造机”
如果说赋能视频创作是 JoyAI-Video-Edit 的“本职工作”,那么它在具身智能领域的潜力则是一个巨大的惊喜。
众所周知,训练机器人需要海量的抓取、搬运和操作视频数据,但依赖真机采集不仅成本高昂,而且很难覆盖危险或极端罕见场景。JoyAI-Video-Edit 凭借其强大的场景与物体可控编辑能力,提供了一条低成本的数据合成捷径。
它能够将普通的人手操作视频,无缝转化为机械手或机械臂的操作素材。更厉害的是,在转换过程中,模型能精准保留物体的空间位置、物理关系以及动作轨迹,同时随意替换背景场景、操作物体甚至机器人的外观形态。这就相当于把一段基础视频“裂变”成成百上千个高质量的训练样本。
结语
从打破视频创作的传统工作流,到为机器人训练提供海量合成数据,JoyAI-Video-Edit 的开源不仅是一次技术秀肌肉,更为内容创作和具身智能两大热门赛道注入了强劲的动力。随着这项技术的普及,我们有理由期待更多颠覆性应用的诞生。
