都在问世界模型怎么落地,PixVerse把答案做成了「好玩」

栏目:游戏 | 来源:机器之心Pro | 2026-08-24 18:08

编辑|张倩、冷猫

这两年,互动娱乐先在线下火了一轮。

比如去河南开封万岁山武侠城,不少游客已经不只是奔着景点和演出去的了。有人专门找 NPC 猜拳、接任务、换「银票」,也有人刷到某个 NPC 的短视频后,直接跑到景区找真人互动。万岁山目前有近 2000 名 NPC,每天上演上千场互动。一些游客甚至会为了没走完的任务和没遇到的角色,专门规划二刷、三刷。

这类体验火起来并不难理解。普通表演,在家刷手机就能知道大体剧情,现场看也就图个视觉效果。但和 NPC 玩就不一样了,每次互动都是自己亲身参与的,一些机智的 NPC 还能现挂,随机抖出金句,去一次能记好久。

这些项目的走红也说明:互动式娱乐的市场,正在爆发。

线下已经玩得这么开了,线上只会更值得琢磨。让我们注意到这点的是 PixVerse(爱诗科技)。今年 1 月份,这家公司推出了业内首个实时视频世界模型——PixVerse R1。玩法相当新鲜:你输入一句话,视频里的内容就会根据你的指令实时变化,让你体验造物主的快乐。

视频链接:https://mp.weixin.qq.com/s/xqfvG-6kQssdiEBAjtdC5g

当时,这个玩法在 X 等社交平台上引发围观,甚至有人说这是一场全新的「注意力争夺战的开端」。这就和万岁山武侠城发生的事情类似:一种互动式的玩法让一群早就受够了静态、被动玩法的玩家重新兴奋起来,注意力被重新分配。线上的互动式娱乐,正等着被引爆。

图源:https://x.com/JaynitMakwana/status/2024757298011525274图源:https://x.com/FutureStacked/status/2012199315196739853

早就看准这一势头的 PixVerse 也在这一赛道继续发力。今天,这种互动式玩法背后的实时生成与交互底座 ——实时世界模型已经全面进化,来到了 R2 版本

在这个版本里,用户开始真正和一个世界进行交互,而且这个世界可以持续、稳定地运行,成为一个能真正「玩起来」的系统。它既回答了实时视频世界模型如何持续 scaling 这个问题,也让世界模型终于有了一个能走出实验室、直面用户的落地形态。

那么,R2 带来的到底是怎样一种体验?我们先来看几个官方释放的内测 case。

从 R1 到 R2,世界模型开始考虑「怎么玩下去?」

R1 发布时,最吸引眼球的是「实时」,它通过实时的响应给了用户变魔术一样的感觉。但如果一个世界真的准备「玩起来」,只会响应一句 Prompt 还远远不够,因为这种玩法只能撑起一时的好奇,很容易就玩腻了。

进入一个世界并与之互动是一件非常复杂的事情,你要解决很多问题,比如用户和世界怎么对话,多模态输入能不能真正生效;延迟扛不扛得住;用户加了新剧情,系统怎么接;世界怎么保持稳定运行,长时间不翻车、不穿帮……

从目前 PixVerse 官方释放的几段内测 case 里,可以看到这些问题似乎已经有了初步的解决方案。

第一个 case 很像一段实时生成的潜入游戏。角色正在躲避追兵,玩家一边用 WASD 控制行动,一边直接用文字改写眼前的局面:输入「增加障碍物阻止追兵」,路上随即滚出一批油桶;要求开启秘密路线,角色附近的墙壁便出现一道石门;进入隧道遇到巡逻兵后,玩家又让角色换上巡逻兵制服,混进人群继续前进。

视频链接:https://mp.weixin.qq.com/s/xqfvG-6kQssdiEBAjtdC5g

这里比较直观的一点是,不同类型的控制开始被揉进同一套体验里。方向键负责「我现在往哪走」,自然语言则负责「我希望这个世界接下来发生什么」,两种输入同时控制,画面都能实时响应。而且,剧情依然保持合理,比如角色换上巡逻兵制服之后,旁边的巡逻兵就自然地忽视了他。

第二个 case 更能说明 R2 在玩法自由度和全局控制方面拿捏的平衡。玩家原本正在一个古风世界里前进,中途突然输入了一句「召唤一只老虎坐骑」,一只和场景风格一致的巨型老虎随即出现在面前;下一条指令是「骑上去」,角色便骑着老虎继续赶路。更有意思的是,这个临时冒出来的奇思妙想并没有把原本的游戏流程打断:玩家继续来到断桥,自然地进入剧情选择,随后骑着老虎越过断桥、选择武器,故事接着向前走。

视频链接:https://mp.weixin.qq.com/s/xqfvG-6kQssdiEBAjtdC5g

这其实是实时生成很关键的一步:玩家可以跑出剧本,但世界还知道怎么把你接回来。过去游戏里的自由,往往来自开发者提前准备更多分支;这里则开始出现另一种可能 —— 主线仍然存在,但主线之间的过程可以临场生成。玩家突然想骑老虎、绕一条新路,未必需要开发者事先把这段内容完整做出来。

另外几段 case 展示的则是另一种互动:和角色直接「聊」。一个三星堆面具形象可以读懂玩家提问,并用方言实时回答,讲话时表情也会跟着变化;另外一段数字人直播里,观众可以在主播讲话过程中直接输入文字插话,主播会迅速接住问题,自然地把话题转过来。

视频链接:https://mp.weixin.qq.com/s/xqfvG-6kQssdiEBAjtdC5g视频链接:https://mp.weixin.qq.com/s/xqfvG-6kQssdiEBAjtdC5g

此外,数字人说话过程中也支持直接语音插话,也就是语音的输出和输入同时进行,画面中的人物对答非常自然,整个过程几乎感受不到明显的等待。

视频链接:https://mp.weixin.qq.com/s/xqfvG-6kQssdiEBAjtdC5g

这类 case 看起没有那么戏剧化,但对互动娱乐同样重要。因为真正自然的互动,不能每次都经历「输入 —— 等待 —— 生成 —— 播放」这一套明显的回合制流程。只有响应足够快,用户才能忘掉背后还有一个模型,把注意力真正放到角色和世界本身。

所以这些 case 里,R2 已经不只是让视频「听话」了。玩家可以用按键控制行动,也可以随时用文字或语音插入新的想法;世界需要立刻做出反馈,同时还要继续沿着原来的逻辑运行。

而要把这些看起来很自然的体验放到同一个系统里,需要扎实的技术支撑。

R2 真正的大改,发生在底层

看完这些 case,问题自然来了:这样的世界,模型要怎么扛?它既要有生成模型的表现力,又要像一个持续运行的系统一样处理输入、更新状态,还得把延迟压到人能够自然交互的范围。很多时候,这些需求是矛盾的。

过去业内的办法是把链路越拆越细:先把双向模型改成自回归模型,再为各个子任务单独训练教师模型,然后做少步蒸馏,最后还得用模型自己生成的历史回头修正偏差。一套流程走下来有五六道手续,每过一道,上游攒下的画质、控制能力和稳定性就要折损一截。这跟传话游戏一个道理,一句话经五六个人接力,传到最后早就走了样。

R2 反过来做这道题,把整条流水线收敛成两件事:第一件,持续预训练一个统一的 Omni Causal AR,把生成质量、长程一致性、多模态控制放进同一个模型里一起养大;第二件,从这个已经跑稳的大模型身上直接蒸馏出一个实时模型,也就是 Real-Time Acceleration,把能力尽量原封不动地加速到可交互的实时运行区间。少了中间环节的反复迁移,新数据、新任务、新控制信号都能进同一条训练主线。这算世界模型训练范式的一次重构。

Omni Causal AR:先把世界的能力上限养大

先说 Omni Causal AR 这个底座。它干的事是把所有输入 —— 文本、参考内容、语音、WASD 这类按键操作 —— 都收进同一个模型,再输出时间同步的音视频流,而且是边运行边接收新输入的。听起来很顺,但要让这么个模型在越来越长的时间尺度上保持稳定,预训练阶段有几个坑是绕不过去的。

第一个坑是,各种控制信号的时间尺度根本不一样。你按一下方向键,要的是立刻的反馈;你输入一段剧情指令,描述的可能是持续好几秒的完整事件。模型要是用固定长度的时间单元去切音视频,就只能在响应速度和表达完整之间二选一。

R2 的解法是 Dynamic Chunk,按控制信号的语义边界自适应切分:操作来了就切短一点,保证响应精度;事件来了就切长一点,保住结构完整。这么做还有个附带的好处:不同类型的任务和数据都能走同一套因果生成接口,进同一个训练过程,这给后面的持续 scaling 留了位置。

第二个坑更隐蔽。训练的时候,模型读到的历史都是干净的真值。可真跑起来,它读到的是自己上一轮生成的历史,里面必然带着噪声和小误差。一个只见过干净历史的模型,单步质量可以很漂亮,但对自己的手误毫无准备,一个小偏差就可能被一路放大下去。

所以 R2 在训练里就掺了带噪的历史,也就是 Hybrid Teacher / Diffusion Forcing,让模型提前习惯不完美的自己。再配合 Causal Attention Mask 管住「当前状态能读哪些历史」、相对时间编码管住「这些历史在窗口里的位置」,训练和现实的差距被拉小,模型在历史已经有点跑偏的时候,也能稳着往下推。

第三个问题是记忆。长期运行不能靠把历史全记住,那样算力先扛不住。可要是裁得太狠,角色是谁、场景长什么样、之前发生了什么,又会丢。

R2 的办法是把记忆分三层管:Sink Memory 负责角色、场景、世界规则这些长期锚点,保证世界始终是同一个世界;Rolling History 盯着最近的动作、姿态和镜头,让眼前的状态自然衔接;Object KV Cache 把对象级的历史压缩复用,只留真正影响后续演化的部分。各管各的时间段,固定的预算里,长期身份和短程连续就都保住了。

最后一个坑,是错误本身。AR 世界模型的严重漂移,源头经常小得不起眼:早期一个小错误被写进历史,后面每一帧都把它当事实继承,错就滚成了漂移。

R2 专门给这类错误建了个 Error Bank,可以理解成模型的错题本,把有代表性的错误历史攒成样本,训练时按比例回放回去,让模型反复练习怎么从出问题的状态里把自己捞回来。这个机制的效果是能拿出数字的:长期亮度漂移指标从 0.201 降到 0.129,降了约 35.8%;29 个长序列样例里 20 个有改善,5 个明确无动作的样例,错误运动全部消除。

Real-Time Acceleration:再把能力加速到实时区间

世界能长期稳定运行了,接下来的问题是怎么让它实时陪你玩。这里最关键的一个决定是起点统一:教师模型、学生模型的初始化、真实的自回归推理,都从同一个 Omni Causal AR 出发。这么一来,少步模型用不着从头学一遍世界,蒸馏这件事也从「重新学习」变成了「少步加速」,前面练成的生成质量、控制能力和长程状态转移,都能直接继承下来。

具体的加速靠三个手段,各管一块成本

DDMD with Adversarial Regularization 管的是蒸馏质量。少步生成里有两个目标天然打架:一边要准确响应各种输入,一边要维持画面的真实感,用一套信号去优化很容易顾此失彼。R2 把条件对齐、分布匹配、对抗正则三类信号分开构造,最后再汇合进同一个学生模型,控制强度和真实感就都保住了。

Block-sparse Attention 砍的是长上下文的计算量。模型按块估计相关性,只把得分最高的一小部分关键连接留下来做精确计算,其余的直接跳过。注意力稀疏度拉到了 90% 以上,评测里画面质量、条件遵循这些指标却没有明显退化,省下来的预算就变成了更低的延迟。

Pyramid Ultra-few-step Distillation 对付的是高分辨率的成本。与其让全部计算都在高分辨率空间里跑,不如先在低分辨率阶段把场景布局、主体运动、镜头结构定下来,再用极少的高分辨率步骤补纹理和细节 —— 粗活细活分开干,重复计算自然少了。

所以把这两层合起来看,R2 做的事其实就一件:上层专心把世界的能力养大,下层专心把这份能力尽量无损地加速到实时区间,中间不让它在迁移里折损。那些互相打架的要求,就是被这样拆成两道工序分别解掉的。R1 证明了实时视频世界模型这个范式能成立,R2 给出的则是它持续 scaling 的方法。一个能一直玩下去的世界,底座就是这么打下来的。

技术报告链接:
https://pixverse.ai/zh/blog/pixverse-r2-scaling-real-time-omni-world-models

世界模型 + 互动娱乐,为什么是王炸组合?

「以电子游戏为代表的互动式娱乐的强大之处在于,即便过了十年甚至十五年,玩过的游戏仍然会留在记忆之中。小说、电影虽然也会让人感动,但经常只记得当时确实感动过,连剧情梗概都说不出来了。然而,游戏是亲身操作、具有参与性的娱乐形式,触动人的方式非常独特,这是游戏的强大之处。」早在 20 多年前,前任天堂 CEO 岩田聪就指出过互动式娱乐的独特魅力所在—— 有输入,有反馈,每一次体验都可能出现一点变化,而用户自己的行动,又参与组成了内容本身。

过去,游戏等娱乐体验已经把这套机制发展得非常成熟,只是游戏里的绝大多数可能性,都需要提前被制作出来。互动,也更多是在固定内容中设计分支。分支设计得再密,玩家能做的,也只是在写好的剧本里挑一条路走。这也让自由始终有个天花板,通关之后,世界就被掏空了。

世界模型加入之后,这条边界开始有机会继续往外推。未来,一个创作者可能先定义世界观、角色、规则、视觉风格和核心剧情,再让一部分具体内容在互动发生的那一刻生成。

在世界模型这条正在快速升温的赛道里,PixVerse(爱诗科技)是较早押注实时视频生成,并尝试把它做成面向普通用户的互动娱乐产品的厂商之一。

R2 今天展示的三个方向 —— 世界探索、剧情互动、实时角色 —— 其实对应着互动娱乐里三个很基础的组成部分:一个让人行动的空间、一套让事情继续发生的叙事以及生活在其中、能够回应人的角色。当这三种东西越来越多地由同一个实时世界模型驱动,游戏、互动影视、数字人甚至线下文旅之间原本很清楚的边界,也可能慢慢变得模糊。娱乐产品的生命周期和商业空间,也可能随之被重新定义。

在评论区,我们也放上 R2 的体验预约链接。感兴趣的读者可以提前预约,待后续体验开放后获取邀请。开发者也可以通过同一入口关注 API 开放信息。

了解更多

猜你想看

← 返回首页