实时世界模型竟然能这么玩?PixVerse R2登上Twitter热榜

栏目:互联网 | 来源:智东西 | 2026-09-24 17:30
智东西作者  毕伟豪编辑|漠影

近日,一款实时世界模型在海外走红,9月22日上线当天就登上了X(Twitter)趋势榜第二。

它为什么会引发这么大的关注?

有海外网友认为,这款模型带来的变化,是让AI生成从“创作视频”转向“与AI世界互动”

还有网友称赞这不像是看视频,更像是身临其境

这就是爱诗科技(AIsphere)最新发布的实时世界模型——PixVerse R2所呈现的效果,在PixVerse R2创造的世界中,用户可以移动、说话,做出选择。


用户输入的每一个提示词、做出的每一个动作,都会实时改变眼前的场景,甚至让剧情走向不同的方向。

回过头来看,AI诞生以来,世界最直观的变化,是内容产生变得更快了,用户输入提示词,就能得到一篇文章、一段代码、一张图片或者一条视频。

此前的生成大多以一次性交付为终点:提示词触发一段内容,生成结束,这次过程也随之关闭。

如何让历史状态、当前输入与后续生成形成连续的因果链,让AI创造的是一个可以被进入、被持续操控和改变的世界,正是实时世界模型探索的重要方向。

这也是爱诗科技(AIsphere)正在探索的方向。

今年1月,爱诗科技发布PixVerse R1通用实时世界模型,开始让用户进入AI实时生成的世界。与传统视频生成不同,用户可以在生成过程中持续输入指令、改变行动,模型也会随之更新眼前的场景。

PixVerse R1首先证明了实时、连续、可交互的音视频生成可以成立;R2则进一步处理这个实时生成的世界,让用户可以在其中移动、探索,也可以通过不同的行为改变眼前的环境和后续发展。

R2的正式上线,也让实时世界模型又一次进入大众视野并引起热议。

▲PixVerse R2上线当天登上X(Twitter)趋势榜

接下来,让我们看一些真实的画面。

一、PixVerse R2实机演示:从看视频到进入世界

进入PixVerse World后,我最先体验的是一个草原越野的世界。

我开着车在草原上驰骋,只需要通过WASD键,就能完成加速、转向、爬坡等操作。

更有意思的是,操作并不局限于移动,我还可以随时给这个世界“加东西”,比如召唤一只雄鹰站到车上、让彩虹出现在指定位置,甚至直接把车点燃。


这里真正吸引人的,其实是输入之后的反馈速度。整个过程中,我不需要退出场景、重新生成,也不用等待一段视频渲染完成,操作和世界变化基本是连续发生的

进入逃离战区这个世界以后,我发现不仅人物可以自由移动,输入指令后还可以做出成功撤离的庆祝动作、召唤闪电或者身上发出代表胜利的金光。

只不过这一次,背后不是游戏开发者预先写好的资源,是AI在即时响应。

而且人物在跑动的时候,持枪姿势也很专业,跳跃和转向都很流畅,可以一边移动一边改变方向,整个过程不会因为一次操作就把交互打断。

《草原奥德赛》这个世界也非常有趣,输入提示词后,我操控的人物身上直接长出翅膀飞起来了,觉得飞太高还能打开降落伞。整个世界的画面随着我不断输入提示词,一直在发生各种各样的变化。


输入指令后,世界很快就会给出反馈,不会出现传统生成式产品里那种“输入一句话,然后盯着进度条等结果”的割裂感。

这是互动影游《零印法师》,我是真的“玩嗨了”,这个世界本身有比较完整的剧情线:主角从一个没有法力的“零印”起步,随着剧情推进签订契约、获得能力,再一路完成逆袭。


最主要的是,AI生成世界和剧情并没有彼此割裂,在体验过程中,我可以不断输入提示词来操控世界。

比如在打前期一个小Boss的时候,我直接输入一个“变小狗”的提示词,下一刻,主角就释放了一个魔法把Boss变成了一只金毛。


这种体验和传统互动游戏最大的不同就在这里:玩家不再只能从开发者预先设计好的几个技能、几个选项里做选择,而是可以直接用自然语言向世界提出要求

从这里也能看出,PixVerse R2在前端和产品化的一些探索,不仅仅停留在WASD的控制上,还可以承载电影级别的画质、音效以及有深度的剧情。

从这些案例中,我体验到的其实是三层不同的交互:

WASD控制角色,体现的是实时响应;自然语言改变世界,体现的是指令理解和动态生成;进入互动影游,则进一步考验AI能不能把交互、剧情、音效和世界状态串在一起。

这也让PixVerse R2创造的世界,开始和传统视频生成拉开距离。

它的目标,是让用户能够持续介入其中,换句话说,用户从“看视频的人”,开始变成了这个世界里的参与者。

而问题也随之出现:当用户不再只是观看,而是持续介入一个AI生成的世界时,模型真正需要解决的,就不只是生成速度,还需要记住已经发生的事情并且理解用户在做什么,然后让这个世界稳定运行下去

二、从R1到R2,真正困难的不是生成世界,是让世界一直运行下去

关于上面这个问题,爱诗科技已经探寻了很久。

2026年1月,爱诗科技推出PixVerse R1通用实时世界模型。和传统视频生成一次性输出一段固定内容不同,R1尝试让用户持续输入指令、改变动作,模型则实时更新世界状态,并连续生成音视频。

视频生成也从确定的结果,变成一个能随着用户输入持续变化的过程

此后半年,爱诗科技继续沿着实时、交互、世界演化这条线扩展,陆续加入个性化Avatar、Shared Worlds与多人共同输入。

同时,通过PixVerse Game Engine把实时世界模型与Agent、游戏机制连接起来,让目标、规则和状态变化为实时生成的画面。

8月23日,爱诗科技发布PixVerse R2技术报告,用Omni Causal AR持续扩展世界建模能力,Real-Time Acceleration则把这些能力带进实时运行区间。

PixVerse R2要解答的问题是:如果AI生成的是一个能够被用户持续干预的世界,这个世界究竟要具备什么能力

要让一个AI生成的世界持续运行,模型首先得看懂用户在做什么,理解用户的动作、意图以及对环境产生的改变;

其次要记住世界发生过什么,让前面的交互能够延续到后面,而不是每次都从头开始;

同时还要维持世界的一致性,让画面、主体和空间关系在长时间运行后依然稳定;最后,还要及时响应用户的下一步动作,让世界能够跟着用户持续变化。

上述要求,对应到PixVerse R2的技术报告中,体现为四个核心能力:长程一致性、多模态控制、因果响应和状态保持

模型既要理解用户的文字、语音和动作,又要让这些输入真正改变后续世界;既要接住前面发生的事情,又要保证世界运行得越久,角色、场景和空间关系不会逐渐失真。

这些要求放到一个实时世界里,并不是彼此独立的。

模型理解得越深、需要保持的状态越多、生成的时间跨度越长,背后需要处理的信息和计算量也会随之增加,但实时交互又要求模型必须及时给出下一步结果。

用户对下一步变化的预期是就在下一秒发生,模型没有太多时间把计算慢慢“算完”。

于是,一个非常关键的问题出现了:如果实时世界模型既要保持实时输出,又要不断增强模型能力,它能不能像大模型一样,找到一条持续Scaling的路径

三、PixVerse R2,把能力上限和实时运行放进同一条路

事实上,实时世界模型既要不断提升能力,又要满足实时交互,这两个目标天然存在矛盾。

PixVerse R2给出的思路,是把“模型能力”和“实时运行”拆开解决,再把两者重新放进同一套训练和推理路径。

具体而言,PixVerse R2通过Omni Causal AR将文字、参考图像、音频、动作等不同信号统一纳入世界建模,让模型进一步理解空间、时间以及用户行为之间的关系,具备持续理解、生成和演化一个世界的基础。

其中最关键的是“Causal AR”,让模型沿着时间持续推进世界,当前的世界状态会成为下一步生成的依据,由此世界也就可以持续往下发展。

Omni Causal AR解决的是实时世界模型的能力上限问题,但模型能力足够强,并不意味着它就能实时运行。对于实时世界来说,用户不会愿意去等待模型慢慢生成下一段内容。

因此,R2又单独做了一套Real-Time Acceleration框架,把推理加速等环节接入实时运行过程。

这里一个比较重要的设计是,同一套Omni Causal AR既作为蒸馏Teacher,也作为学生模型的初始化基础,让实时模型沿着原本的世界建模能力继续演化,而不是重新从头训练一个只追求速度的模型。

这样一来,R2形成了两个彼此衔接的核心层次:Omni Causal AR负责持续扩展世界模型的能力上限,Real-Time Acceleration负责将这些能力带入实时、可交互的运行区间。

技术报告也将两者概括为一条演进路径:持续扩大世界模型的能力,再将这些能力稳定加速到实时运行。

这条路径并只对应R2的升级,它是爱诗科技对于实时世界模型Scaling方式的技术回答。

PixVerse R2通过Omni Causal AR和Real-Time Acceleration的组合,将实时世界模型的能力扩展与实时运行连接起来。

更重要的是,R2并没有把Scaling简单理解为扩大规模,而是将实时世界模型的扩展拆分为模型、数据、任务、控制信号、时间尺度五个维度。

这五个维度并不是彼此独立的,模型规模决定能力上限,数据和任务决定模型能够覆盖的世界范围,控制信号决定用户能够通过多少种方式介入世界,时间尺度则决定模型能否在更长时间里保持世界状态并持续演化。

从这个角度看,R2探索的是一条从能力提升、实时加速到持续Scaling的路径:让这些维度能够沿着同一套训练路径继续扩展,并最终转化为实时世界模型的能力增长。

结语:从“生成一段视频”到“创造一个世界”

从文章、代码、图片到视频,生成式AI过去解决的,更多是“给我一个结果”,通用模型正在改变这个状态。

当模型能够理解用户行为,并根据已经发生的状态继续生成,AI交付的就不再是一段固定内容,而是一个可以被进入、被操控、不断变化的世界。

PixVerse R2探索的,正是从“生成内容”到“生成世界”的演变过程。游戏之外,互动影视、虚拟角色、教育培训、工业仿真等场景,同样存在大量需要根据用户行为实时变化的内容。

过去,这些变化需要提前设计和制作;未来,其中一部分可能在用户真正进入之后才发生。

这或许才是通用实时世界模型真正打开的空间——让AI负责一个世界的诞生和运转。

了解更多

猜你想看

← 返回首页