
新智元报道

这个 8 月,AI 视频赛道的军备竞赛又升级了。
字节跳动发布 Seedance 2.5,把单次视频生成时长从 15 秒翻倍到 30 秒。同一天 MiniMax H3 开源,价格只要闭源旗舰的三分之一。
整个赛道争的还是同一个指标:谁能一口气生成得更长、更连贯、更便宜。
但这场比赛有一个所有人都默认的前提:你得先等视频生成完,看一下,才知道自己想不想改。如果想改,对不起,重新排队。
有意思的是,隔壁语音赛道已经把这个前提拆掉了。就在几周前,OpenAI 发布 GPT-Live,语音交互从「说一句等一句」的回合制进化成全双工——AI 能边听边说,不用等你把话讲完。

语音对话率先证明了一件事:「实时」本身就是一种新范式。
8 月 5 日,京东把同样的事情搬到了视频编辑上。
京东开源的 JoyAI-Video-Edit,是这个赛道里第一个同时做到「流式架构 + 实时速度 + 可用质量」的模型。
部署代码、技术报告、在线 Demo 和模型权重同天在 Hugging Face 和 GitHub 上放出。
开源地址:
GitHub:https://github.com/jd-opensource/JoyAI-Video-Edit
Hugging Face:https://huggingface.co/jdopensource/JoyAI-Video-Edit
实时视频版的Nano Banana
先说一下JoyAI-Video-Edit的效果——
720P 分辨率下模型推理速度达到每秒 30 帧,系统端到端稳定在 24FPS,而且支持任意时长的稳定流式编辑。视频可以一直播、一直改,没有时间上限。
换句话说,对着视频你可以不断动动嘴实现各种视觉特效。
变老、变年轻、变成乐高小人,甚至是拉布拉多,一句话的事,就能实时渲染出来。
太好玩了。
下面这视频,你能想象是实时测试出来的效果吗?

比如说,直播间里,家装视频播到卧室,枕头、床单、画和灯光当场换一遍,室内装修直接上一个档次。

这事可不简单。
Seedance 2.5、MiniMax H3这些是视频生成模型:从文字或图片出发,造一段视频。
Runway Aleph、VACE做的是视频编辑:拿到一段已有视频,按指令改人物、换背景、调风格。
但不管生成还是编辑,这些模型都有一个共同特点——它们是离线的。把整段视频吃进去、整段处理完、整段吐出来。
流式视频编辑是第三件事。它可以实时处理任何一条「活的」视频流上:直播、视频通话、摄像头画面、游戏画面。
JoyAI-Video-Edit不仅是「流式」视频编辑模型,还能实现「实时」视频编辑。
简单说,「流式」决定了模型能不能挂到一条活的视频流上边来边改,「实时」决定了改的速度跟不跟得上播放。两个都得有,缺一个都不行。但在 JoyAI-Video-Edit 之前,这个赛道没有一个够到 24 帧,也就是视频流畅播放的最低门槛。

要「边播边改」,先过两道硬坎
让视频在播放中实时编辑,听起来很炫酷,但技术上得跨过两道门槛。
第一道门槛是速度。视频这东西,本质就是一帧帧画面按固定节奏刷过去,一般是每秒 24 到 30 帧。模型处理得比播放慢,画面就卡。
JoyAI-Video-Edit 的做法是,画面来一帧就改一帧,改完立刻往外送,不用等后面的画面到齐,也不用提前知道这段视频到底有多长。打个比方,这就像同声传译——听一句翻一句,不用等演讲者把整段讲完。
它的底层架构是一个 MLLM 条件编码器、一个因果视频 VAE,再加上一个 16B 参数的多模态扩散 Transformer,整套系统按自回归扩散编辑器来训练和部署。

160 亿参数的模型,按正常流程跑一帧要反复迭代很多步,离实时差得远。
团队的做法是把这个过程「蒸馏」掉,用一种叫 SA-DMD 的训练方法,让模型从原来的十几步迭代压缩到只走两步就能出图。相当于一个老教授本来每道题都要在草稿纸上演算半天,现在被训练成了看一眼就能报答案的老手。

在单张 Nvidia B200 GPU 上,VAE 编码 22 毫秒、DiT 去噪 185 毫秒、VAE 解码 19 毫秒,整个流程的请求到响应延迟只有 226 毫秒,端到端吞吐量达到 30.1 FPS。
这里有一个值得注意的细节:之前所有流式编辑器都为了跑得快,把模型做小。StreamDiffusionV2 和 LiveEdit 都是 1.3B 参数,SANA-Streaming 是 2B,分辨率也压到 480P。结果是快而废,画面质量拉不上来。
JoyAI-Video-Edit 使用16B 参数,720P 分辨率速度快 1.4 到 2 倍。
第二道门槛是时长。此前的流式编辑模型基本只能处理几秒钟到一两分钟的片段,越往后画面越容易「漂」。
颜色变了、物体变形了、风格跑偏了。根本原因在于,自回归模型在推理时不断消费自己之前的输出,一点误差经过多轮累积,最后就变成了肉眼可见的崩坏。
而且流式编辑比流式生成更难。流式生成只需要跟自己的历史保持一致,没有标准答案,画歪了也叫创作。流式编辑要同时满足三个互相打架的约束:前面改过的画面不能跟后面打架,改完的结果不能跟原视频长得面目全非,而且同一条编辑指令从头到尾得改得一样。
JoyAI-Video-Edit 技术报告给出的解法叫「有界 KV 状态推理」。说白了就是限制模型的记忆量:让它只记住最近处理过的几段画面,再加上视频开头的第一帧当参照,其他的全部扔掉。这样不管视频播了一分钟还是一小时,模型的计算量和内存占用始终是固定的,不会越跑越慢。
但光限制记忆还不够——记得少就容易忘,忘了就容易画飘。团队在训练阶段专门针对这个问题做了优化:让模型反复练习在「只记一点点」的条件下编辑长视频,直到它学会在有限记忆里也能把画面稳住。
结果就是:视频可以一直播下去,编辑效果始终稳定。
流式赛道断层领先,追平离线主流
喊「领先」容易,但终究要拿数据说话。研究团队做了两轮对比测试。
短视频评测(OpenVE-Bench):在这个业界权威的通用视频编辑基准测试中,JoyAI-Video-Edit 的总分达到 3.60,对比流式编辑模型 SANA-Streaming(2.62)、LiveEdit(2.00)、XMax-X2.0(1.87)和 StreamDiffusionV2(1.23),在五个子任务中有四个拿下流式模型第一。

全局风格转换、局部替换、局部删除这几类任务上优势尤其突出,其中局部删除的 4.06 分甚至超过了所有离线模型。
把这组分数放到整个赛道里看会更清楚。此前流式编辑模型的分数区间是 1.23 到 2.62(满分 5),这个区间的含义不是「稍差」,是基本不可用。对比之下,商业闭源的 Runway Aleph 是 3.45,PixVerse V6 是 3.05。
JoyAI-Video-Edit 的 3.60 已经站进了离线商业模型的区间。一个实时跑的模型,画面质量追上了那些慢慢离线处理的前辈。
长视频评测(LongV2VBench):团队还专门构建了一个视频编辑任务的基准测试,覆盖背景更换、全局风格、局部添加、局部修改和局部删除五大类场景。
JoyAI-Video-Edit 在全部五个类别上都排第一,总分 3.30,比最强对手 XMax-X2.0 高出 1.59 分。同时速度也最快:30.19 FPS,比 XMax-X2.0 快了 44.4%,是 SANA-Streaming 的两倍多。

人类评估的结果更直接:在与四个流式编辑模型的两两盲评中,JoyAI-Video-Edit 的偏好率分别是 90%、87%、87% 和 81%。面对强离线模型 Bernini-R,打了个 48% 对 44% 的微弱优势。

准确的判断是:JoyAI-Video-Edit 在流式编辑赛道断层第一,在全赛道追平了主流离线水平,但还没打赢最强的几个离线商业模型。它证明了流式编辑和离线编辑之间的质量鸿沟,可以被填平。
真正改变的是干活的方式
流式实时编辑这个能力,到底能让干活的方式发生什么变化?
第一层变化:「等渲染」这件事消失了。
不管是做特效、搞三维还是用 AI 生成视频,干活的人最熟悉的循环就是:调一下参数,等,看一眼结果,不满意,再等。创作的手感就死在这个「等」字上。
JoyAI-Video-Edit 的响应延迟只有 226 毫秒,快到你感觉不到延迟。拧一下色调视频立刻变,拧一下风格立刻换,不满意立刻拧回来,把后期变成了现场。
现在,可以边直播边创作。这和元宇宙、VR、AR可能还有区别,但视频编辑的星星之火,未尝不可燎虚拟现实之原。
第二层变化:从「一次拍摄 = 一个成品」,变成「一次拍摄 = 无数个成品」。
这条最能解释京东为什么要干这件事。今天你想要五种配色的服装视频,就得渲五版、存五份文件。如果编辑是实时的、流式进行的,那么变体可以按需生成——同一条直播流,系统可以给不同的人呈现不同的搭配、不同的背景。
通过参考图引导编辑(RV2V),上传一张衣服图片就能把视频里的人物实时换装,动作、姿态全部保留。这个能力放到电商直播里,意味着观众看到的每件衣服,都可以是为他实时生成的版本。
第三层变化:摄像头和屏幕之间,第一次多了一个可编程的语义层。
既然视频播多久它就能改多久,那它就能挂到任何一条正在播的视频流上——直播、视频通话、摄像头画面都行。
这跟美颜滤镜可不是一回事:滤镜不看画面里有什么,只是逐帧套一层效果,前一帧和后一帧之间也没有关联。流式编辑是看懂了画面内容再改,而且前后帧改得连贯一致。
导演、设计师或客户不需要等待多个完整版本,而是可以在同一段运动画面上不断调整对象、颜色和风格,观察这些变化在不同角度、光照和动作下是否成立。
它降低的不只是渲染时间,还有团队形成共识的成本。
换句话说,模型的价值不只在于更快生产最终内容,还在于帮助人们更快排除错误方案。
这类能力很可能先进入预演、评审和远程协作环节,因为这些环节对实时反馈的需求,往往比对最终画质的要求更高。
沿着这个方向往外走,实时虚拟试衣、真人主播流的风格化改造、游戏和虚拟制片的实时后处理,都是它能接的活。
更远的一步:从直播间到机械臂
如果只是做内容创作,JoyAI-Video-Edit 已经很好用了。但京东想把这件事往更深处推。
具身智能行业现在有一个公认的瓶颈:机器人训练需要海量的抓取、搬运和操作视频,但高质量物理交互数据极度稀缺。
行业里现在要把一段人手操作的视频变成机器人训练数据,得串好几个模型。一个模型把画面里的人手抠掉,一个模型把抠掉的地方补上背景,再来一个模型把机械臂渲染贴回去。全串起来一放量,到处卡。
JoyAI-Video-Edit 把这条流水线压成了一句话。物体位置、空间关系和动作轨迹全部保留,只换机器人形态,30 FPS 实时跑完。

这不是京东拍脑袋想的方向,而是跟它这两年在布局的另一盘棋直接相关。
京东手上的 JoyAI 模型矩阵,现在已经凑齐了一套班子:JoyAI-VL-Interaction 让机器持续「看」并做出实时反应;JoyAI-Talker 让机器能「说」也能「听」;JoyAI-RA 让机器人学会抓取和操控;JoyAI-Video-Edit 则负责批量造训练这些机器人所需要的视频数据。
看得懂、听得懂、说得出、抓得住、还能自己造训练素材。
这些能力拼在一起,干的就是京东每天的活:管仓库、跑物流、送快递、开直播。京东说要建「全球最大的物理世界运营中心」,不是喊口号。
它的生意本身就长在物理世界里,这套模型矩阵就是给自家业务攒的基建。
编辑:大卫 所罗门