从苹果落地到牛顿定律,Apple-π 把视频模型的物理推理过程摆上考场

栏目:科技 | 来源:机器之心Pro | 2026-07-30 13:15

一个苹果从树上落下,今天的视频模型大多能生成一段「看起来正确」的运动:苹果向下、速度加快,最终落地。

但模型是真的理解了重力定律,还是只是在复现训练数据中的视觉统计规律?

这一区别,决定了视频模型究竟是擅长制造逼真画面的生成器,还是能够预测世界演化的「世界模型」。现有物理视频基准多聚焦最终结果是否合理,却很难回答模型究竟在哪一步出了错:没有读懂场景?选错了定律?还是无法把定律稳定地执行到每一帧?

近日,来自南洋理工大学 S-Lab 与香港中文大学的研究团队发布 Apple-π。该工作将视频模型的评测显式锚定在物理定律上,并把生成视频视为一条可见、可审计的「逐帧推理轨迹」。它不只问结果像不像真的,更追问模型是否经历了从感知、定律表述到演绎的完整科学推理过程。

图 1|Apple-π 整体框架。 左侧展示依赖视觉直觉的「亚里士多德式」生成,右侧展示由物理量和定律驱动的「牛顿式」演绎;下方为 Orchard 数据集、五条评测赛道及主客观结合的评测体系。

  • 论文地址:https://arxiv.org/abs/2607.16401
  • 项目主页:https://21yrm.github.io/Apple-PI-homepage/
  • 代码仓库:https://github.com/21yrm/Apple-PI

从「像物理」到「按物理定律推演」

论文用亚里士多德与牛顿作了一个形象的对照:前者依赖对现象的直觉描述,后者则从现象中抽象出普适定律,再由定律推演未来。

对应到视频生成,普通提示词只要求「生成一个苹果从树上落下的真实视频」,模型只需产出视觉上合理的结果;Apple-π 则给出重力加速度、初始速度等明确条件,要求模型遵循相应公式生成运动。

为此,Apple-π 由三个部分组成:力学视频数据集 Orchard、分阶段的基准协议,以及融合主观与客观指标的评测套件。三者共同把「视频模型是否懂物理|从一个笼统的观感问题,变成可以逐环节定位的工程问题。

400 段视频搭起一座「力学果园」

Orchard 包含 400 个案例,覆盖 10 类经典力学任务。数据来自三种互补来源:243 个高保真仿真案例、121 个受控条件下的实拍案例,以及 36 个来自物理教育视频的互联网案例。

任务体系采用「定律优先」的设计。单定律分支覆盖自由落体、抛体运动、斜面运动、圆周运动,完全弹性、完全非弹性和一般非弹性碰撞,以及静止与匀速直线运动;多定律分支则把多个阶段串联起来,例如物体先沿斜面运动,再进入抛体阶段,考察模型能否把前一条定律产生的位置、速度、方向和接触状态,正确传递为下一条定律的初始条件。

为了减少物体语义带来的干扰,动态物体被统一为球、立方体、圆柱体和圆锥体四种基本几何体。这样既便于获得一致的中心、掩码和接触面,也能把评测重点留在运动规律本身。

图 2|Orchard 数据集的来源与任务体系。 400 个案例由 243 个仿真案例、121 个自录案例和 36 个互联网案例组成,覆盖 9 类单定律任务及 1 类多定律组合任务。

五条赛道拆解视频模型的「物理思维链」

Apple-π 把科学推理拆成三个阶段、五条子赛道。

感知阶段首先检查模型能否读出首帧中的质量、速度、时间等物理量,并定位真正参与实验的物体。定律表述阶段进一步检查模型能否从四个候选公式中选出支配运动的定律,以及能否预测指定时刻的物体位置、速度方向和速度大小。最后的演绎阶段要求模型生成完整运动序列,并将每个评测时刻的轨迹与物理定律推导出的真值逐帧比较。

所有赛道都使用带信息图标注的首帧作为输入,并通过 chain-of-frames 提示让答案在视频中逐步显现。前四条赛道以最终帧中的文字、分割结果、公式或目标状态作为答案;演绎赛道则直接评估完整视频。由此,视频不再只是最终产品,也成为模型外显的推理载体。

图 3|Apple-π 的五条评测赛道。 模型以带物理量标注的首帧为输入,分别完成物理量读取、目标物体分割、支配定律选择、目标状态预测和完整动态演绎,生成结果构成可审计的逐帧推理轨迹。

不只判断「看起来对不对」

Apple-π 的评分同时包含两条轴线。多模态大模型评审负责文字可读性、格式遵循、物体一致性、视觉质量和运动平滑度等难以仅靠公式判断的维度;物理定律驱动的客观指标则比较目标掩码、像素、时空轨迹和速度误差。

尤其在演绎阶段,物理正确性占最终得分的 60%。这意味着一段视频即使画面精美、运动流畅,只要轨迹、时序或碰撞响应违反定律,也无法靠「视觉合理性」掩盖问题。

11 个模型的测试结果说明了什么?

研究团队评测了 5 个视频生成模型和 6 个理解 - 生成一体化模型。每个模型需要完成 400 个案例、5 条子赛道和 3 次独立生成,共计 6000 个评测响应。

需要指出的是,一体化模型在前四条赛道生成最终答案图,在演绎阶段生成带时间戳的关键帧;视频模型则生成完整序列。因此,前者更适合作为理解 — 生成架构的对照,而不是单纯的视频画质横评。

结果显示,当前视频生成模型距离可靠的「定律驱动世界模拟器」仍有明显距离。

表现最好的视频模型 Seedance 2.0,平均得分为 0.473。作为架构对照,GPT Image 2 和 Nano Banana 2 的综合得分分别达到 0.704 和 0.699,优势主要来自感知与定律表述阶段;但即使最强的统一模型,在演绎阶段也只有约 0.40。这说明把物理定律稳定地展开为时间连续的动态,仍是核心瓶颈。

图 4|11 个模型在 Apple-π 上的综合表现。 Seedance 2.0 以 0.473 位列视频生成模型第一;GPT Image 2 和 Nano Banana 2 在理解 — 生成一体化模型中分别取得 0.704 和 0.699。该排名衡量的是综合物理推理能力,而非单纯的视频画质。

进一步分析呈现出一个清晰的「推理漏斗」:感知最容易,定律表述更难,演绎最难。模型可能读对数字、选对公式,却仍会在持续运动中丢失物体身份、速度方向、加速度或碰撞时刻。

多定律任务也普遍难于单定律任务,暴露出跨阶段状态传递能力不足;而在相同物理定律下,真实视频得分又低于仿真视频,显示视觉变化、跟踪和场景落地仍带来持续的 Sim-to-Real 差距。

图 5|分阶段、分定律与分数据源的诊断结果。 模型得分从感知、定律表述到动态演绎逐级下降,呈现明显的「推理漏斗」;多定律组合任务更加困难,真实场景相较仿真场景也存在持续的 Sim-to-Real 差距。

论文中的定性案例进一步说明:模型可能完整保留标注、正确分割物体,却把初速度箭头绑定到错误方向,最终让目标时刻状态和整段轨迹同时偏离真值。

换句话说,「看见标注」并不等于「理解物理变量」。

图 6|Apple-π 揭示的典型失败案例。 模型能够正确复制文字标注并定位目标物体,却将初速度线索绑定到错误方向,最终导致目标时刻状态和完整运动轨迹均偏离物理真值。

从「会生成」到「会推演」

Apple-π 目前聚焦经典刚体力学、基本几何体和固定相机,尚未覆盖流体、热力学、电磁学、形变与破碎等更复杂现象。但它提供了一种重要的评测范式:世界模型不能只靠「看起来像真实世界」来证明自己,而应当能够读取明确条件、选择正确规律,并在时间维度上给出可验证的演绎结果。

从亚里士多德式的直觉模仿,到牛顿式的定律推演,Apple-π 把视频模型的物理能力变成了一条可观察、可测量、可定位故障的推理链。

研究结果也指向同一个方向:下一代视频世界模型不仅需要更强的时序生成能力,还需要显式的理解模块、更丰富的物理推理数据,以及真正奖励「长期遵守物理定律」的后训练机制。

作者介绍

本工作由南洋理工大学 S-Lab 与香港中文大学联合完成。Runmao Yao、Kairui Hu 为共同第一作者,Ziwei Liu 为通讯作者,其余作者包括 Yukang Cao、Ruisi Wang、Shulin Tian、Ziang Cao、Weichen Fan、Ziqi Huang、Yuhao Dong、Hao Li、Zhaoxi Chen、Zhongang Cai 和 Lei Yang。

了解更多

猜你想看

← 返回首页