允中 发自 凹非寺
量子位 | 公众号QbitAI
太卷了!过去两年,视频生成模型把画面参数几乎卷了个遍。
4K、物理一致性,画面越来越真,时长也越来越长。
但传统视频生成模型生成的永远是一段固定、预设的成品视频,你无法干预剧情、不能调整视角、更不能改变下一秒画面内容。
世界模型带来的变化,恰恰在这里。
它会跟随操作实时渲染、动态生成世界
按下前进键,前方场景实时延展生成;转身回望,身后的街道即刻演算而出。
你不再是被动的观看者,而是真正的参与者
而现在,做这件事的团队多了起来。Google DeepMind的Genie 3、腾讯的WorldPlay、蚂蚁的LingBot-World,以及一批创业公司,都在推进这个方向。

放眼当下,世界模型已经初步实现了可自由探索、实时交互的视觉场景。画面质量、帧率、持续生成时间以及稳定性,都有了很大提升。
可当你戴上耳机沉浸式体验时,就会察觉致命短板:这片世界,一片寂静。
你漫步街巷,车辆从身旁驶过,却没有呼啸而过的轰鸣;你推开厚重的木门,门板缓缓转动,却听不到一丝铰链摩擦的声响;你看到野兽就在不远处低吼,身躯清晰映入眼帘,耳边却一片死寂。
有画无声,不成世界。
首发!可交互音视频世界模型HelixWorld 1.0
现在,这块最明显的短板,终于有人补上了。
Noiz AI联合来自香港科技大学、清华大学、CMU、Google DeepMind等机构的研究员,刚刚发布了实时可交互音视频世界模型HelixWorld 1.0
丢进去一张图和一句提示词,眼前就会展开一个持续生成的世界。
接下来就不一样了。
你不再坐着看。往前走、转个身,画面和声音会同时跟上。你走到哪,世界就延伸到哪。
这次补上的,是世界对用户行动更完整的实时响应,远不止一条音轨。
在可交互的世界里,声音承担的远不止BGM。
离多远、踩在什么材质上、从哪个方向来,都会让它不一样;身后的脚步、拐角外的碰撞,往往只有耳朵能先听到。
参数也相当硬核,HelixWorld支持24 FPS实时生成画面,同时输出48kHz双声道音频
真正关键的还在后面。画面和声音由原生Transformer架构统一生成,从一开始就绑在一起,不会等视频做完再另配一条音轨。
声音和画面来自同一个世界,用户的每一次操作,都会同时作用在两个模态上。
声画一起生成,声音跟着场景转,还能实时交互,是HelixWorld和现有方案不同的地方。放进现在可交互世界模型的对照里,会更清楚:

好戏才开始。接下来几周,HelixWorld的模型权重和代码将完全开源。(详见后续章节)
路线:让世界具备原生多模态响应
给视频补一条音轨不难,难的是让不同模态从生成一开始就属于这个世界。
为了达到这个目标,HelixWorld把路径拆成四步。
第一步:构建带空间和动作的音画/世界数据
数据决定上限。世界模型能走多远,很大程度上取决于它训练时见过什么样的世界。
△数据采集与处理流程总览

可交互世界模型既要看见画面,也要知道什么操作引发了下一刻的变化。
视觉侧已有成熟解法,可以用位姿估计模型反推每一帧的相机轨迹,生成动作标签。可一到声音侧,几乎没有现成数据可用
现有技术报告通常会筛分辨率、时长、镜头切换等等,却很少管声音。道理很简单,它们本来就没打算生成有声世界。
但音视频世界模型还得弄清更多事:音轨是不是现场录制,声源在哪,听者转身后声场怎么变,空间会留下多久回响。
麻烦的是,现成数据集给不齐这些答案。
团队干脆两条腿走路,同时从真实世界游戏世界取材。
真实世界的数据来自公开网络视频,其中最宝贵的是第一人称连续行走素材
镜头持续移动,环境声同期录制,声画天然对齐。反射、遮挡、材质这些空间信息都来自真实环境,这一批主要用来保真。
游戏世界则补上精确的空间关系。游戏引擎同时模拟视觉和听觉,几何、材质、声源位置和听者朝向都是已知的。距离衰减、墙体遮挡这些也有明确规则,每一声都能对上物理位置。
更省事的是,游戏数据天然带有动作标注,画面、声音与操作可以直接对齐。
原始素材还得再洗一遍。视觉侧按镜头切片,去掉剪得太碎、运动太少、画质太差的,台标、水印、字幕也滤掉。
音频侧没有现成经验,团队就自己搭清洗流程:去掉左右声道完全相同的伪立体声,清掉和画面对不上的后期配乐,再用语义筛选去掉旁白和外加音效,只留现场声。
留下的片段还要做声画对齐校验。系统逐帧计算声像位置和左右声道能量,再和画面里的声源方位、事件时刻逐一比对。
汽车从画面右侧驶向左侧,声像就该同步从右滑到左;碰撞发生在哪一帧,音轨上的能量峰值也得落在那一帧。空间对不上、时间错开的,直接丢掉。
标注也不再只盯着画面。除了带真实尺度的相机位姿和视频描述,每段素材还会加上音频描述与音视频联合描述,把声音和画面里的声源对应起来。画外声则单独记下,免得模型自己编。
走完整条管线后,团队得到百万量级训练片段,音质、立体声和帧级对齐都达标。随后再用人工标注数据训练分类器,按声画配合度与声场空间感打分,筛出高质量微调子集。
到这里,声音侧终于有了能用的训练数据。
数据解决模型见没见过的问题。下一步,是让声音和视觉进入同一套世界建模。
第二步:让画面与声场共同响应动作
团队以音视频生成基座LTX2.3为起点,引入动作控制。
音频和视频保留各自的latent表征,但会进入同一套Transformer联合生成,并持续交换信息。
模型要学的是:根据当前状态和用户动作,预测下一刻的画面与声音。
人往前走一步,透视、遮挡和声源距离都得变;人一转身,整个声场也得跟着转。原来在正前方的声音,转到侧后方,这才算真转过身了。声画有一路没跟上,沉浸感马上就破功了。
这一阶段仍采用全序列可见的双向模型,先不追求实时。团队先把动作控制和联合生成做准,再来攻速度。
具备动作控制后,团队用微调数据集做针对性微调。
关键不只是模型能不能动,还要看脚步有没有踩对材质、混响是否匹配空间大小、声源方位会不会跟着视角转。动起来还不够,得动得像那么回事。
最基础的一关,是事件发生时声音必须同步出现,回响也要符合空间和动作。循环BGM、素材库音效和事后贴轨造成的伪同步,都要排除。
空间关系不能只凭耳朵觉得像。画质有FID、FVD,音质有FAD,音画同步有Desync,声音的方位和距离对不对得上画面,一直缺自动化标尺。听着差不多还不够,位置必须对上。
到这里,HelixWorld已经能让声画一起响应动作,但训练阶段的模型仍依赖“未来信息”,还无法真正实时交互。
第三步:让模型只看过去也能持续生成
因果化、KV Cache、自生成历史训练
传统视频扩散模型采用双向生成。计算第10帧时,它可以参考第20帧,因此更容易保持连贯。
可在交互世界里,第20帧还没发生,用户下一秒往哪走也不知道,没法提前看后面的帧
HelixWorld因此将双向预训练模型改造成因果模型,只允许它查看过去。同时通过KV Cache复用已计算的历史信息,逐块自回归生成,持续输出音频和画面。
因果化分两步。
第一步用真实数据微调,让模型先学会不依赖未来,也能继续生成音视频。
真正棘手的是第二步,训练和部署面对的历史数据并不相同。
训练时,模型看到的历史干净且正确;部署时,它看到的是自己刚生成的结果,误差早已混在其中。
如果模型始终拿这些数据训练,上线后就会拿着错答案继续作答。小误差一路滚,最后就是声画双双跑偏。
团队的解法很直接:训练时就让模型读自己生成的历史,再去预测正确结果,提前练习带着误差继续往下走。
这一步让模型从生成一小段,迈向持续生成。但能一直跑,还不等于能实时跑。几十步去噪依然太慢,用户按下方向键后,留给声画响应的只有几十毫秒。
第四步:让世界从“生成片段”走向“持续运行”
最后一关是速度。团队要把原本几十步的去噪压到个位数,同时省掉文本条件引导带来的额外前向计算。
主流少步方案DMD,也就是分布匹配蒸馏,常见副作用是画面过曝。
优化过头之后,高光溢出、色彩过饱和、暗部细节没了,画面看着更亮,其实已经失真。
HelixWorld的解法,是把轨迹蒸馏和DMD放在一起
轨迹蒸馏让学生模型沿着教师模型的去噪路径走,给少步生成一个比较稳的基线。DMD负责守住最终分布,避免步数压下去之后偏离教师模型。
再配合因果化后的KV Cache和逐块生成,动作输入、联合生成与音视频输出被串成连续流水线。
上一块刚生成,下一块已经开始算,不用等整段视频做完再一起交出去。
至此,模型终于跨过实时门槛。画面与声音边生成边输出,用户的每一次操作,都能立刻得到回应。
四步走完,HelixWorld的技术链路算是完成了。
开源:底色和底气
HelixWorld的权重和代码,将在接下来几周完全开源,把整套技术摊开来给全世界分享。
仓库链接:https://github.com/NoizAI/HelixWorld
巧的是,开源这边又热闹起来了。不久前Meta也重新回到了开源群,扎克伯格回心转意:限制开源是大错特错。
黄仁勋也给出相近判断:开放权重,是AI生态健康发展的前提。
对Noiz AI来说,开源是长期以来一直在做的事。
该团队组建于2025年底,成员来自Meta、Google、Dolby、清华等机构,开源项目累计超过5万GitHub Stars
创始人陈伟嘉(Vega)在Meta主导Yann LeCun(杨立昆)团队ASR模型落地,当时公司93%以上代码都是开源的;后来还开源出过很火的Mockingbird。
首席科学家田泽越(Zeyue Tian)作为作者开源过AudioX、YuE等工作,其中ChatMusician还被杨立昆转发过。
从Mockingbird到AudioX,再到HelixWorld,开源一直是这支团队的底色
Noiz并不担心被超越。
早在上一年底,团队在这条路线就已经开始布局。
目前模型的API已经在内测中,团队在应用侧也正在悄悄搭建一个全新的交互内容社区,并从创作者和用户中源源不断获取宝贵的使用数据和反馈。这些都是更实打实的底气。
HelixWorld 1.0,是Noiz AI对世界模型下一形态的回应:视觉从成片走向实时漫游,声音也正成为更关键的一环。
开源,更多是希望生态更丰富一点。模型被拆开、复现、接到更多系统里,全行业一起跑,后面那一页也能更早到来。
代码打开了,真正难的部分才开始。
从旁观世界,到参与世界
今天,大多数多模态模型还是围着Prompt转:输入一句话,完成一次生成,任务就结束了。
但真实世界不会因为Prompt结束就停住。环境还在变,人还在动,新事件也还在发生。世界模型得一直跑着,不能用完就关机。
它得知道正在发生什么,记得已经发生过什么,并对接下来的变化即时作出反应。
HelixWorld补上的实时音视频交互,只是第一步。
再往前一步,世界里不会只有一个人。
第一个方向,是多智能体(Multi-Agent)
每个角色都有自己的身份、目标和记忆,彼此可以协作,也可能起争执。故事不会完全按剧本走,更多是角色碰上之后自己发展出来。
第二个方向,是多人现场
当人和智能体同时进到一个空间,模型得听清说了什么,还得分清谁在说、对谁说、声音从哪来。
抢话、停顿、眼神这些,都可能把下一秒的关系带偏。把所有人的声音收进来只是门槛,难处在于读懂整个现场。
接下来,还有更硬的一关:超长时间一致性
如果世界要跑上几小时、几天,甚至更久,角色还得记得自己是谁,昨天推开的门今天得还开着,一次对话和一个决定也得真的留下痕迹。
到这一步,一致性就不止人物不变脸、场景不乱漂。身份、记忆、空间状态和因果关系都得接得上,世界得有自己的历史。
再往远处看,是世界的自主进化
未来就算没有新的Prompt,也没有人在场,世界还能按自己的规则跑下去。
角色会结成新关系,城市和资源也会继续变。你开口,世界会回应。你转身离开,里面的故事仍在继续发生。
当这几件事真正叠在一起,游戏、互动影视、教育这些场景都会被改写。