近日,一家面向通用具身智能的新公司 —— 原方智能(Cirquar AI)正式启动。公司同时发布启动宣言《让机器拥有关于世界的信念》,将世界模型确立为核心技术路线。

官网地址:www.cirquar.ai
原方智能由南京大学 LAMDA 实验室博士生林浩鑫与机器人学院助理研究员唐开强共同创立,技术积累源于 LAMDA 团队围绕环境模型、虚拟环境、模型驱动策略学习、因果世界模型和具身世界模型展开的八年持续研究。
原方智能的目标是让机器在信息不完整、环境持续变化、行动具有真实后果的物理世界中,形成对当前状态、潜在规律、行动后果和自身不确定性的持续判断。原方智能把这种判断称为机器关于世界的「信念」。
「信念不是拟人化的情感表达,」 原方智能 CEO 林浩鑫表示,「它是智能系统依据有限观察和既有经验,对不可完全观测的世界状态形成的可更新估计。世界模型就是形成这种信念的基础 —— 它将零散观察组织为内部状态,将经验沉淀为变化规律,在行动发生之前展开多种可能的未来。我们认为,这是通往通用具身智能的关键路径。」
创始团队:学术与产业双重基因
林浩鑫任 CEO,是南京大学 LAMDA 博士生,师从俞扬教授,长期关注世界模型、具身智能和离线强化学习,以一作身份发表的 ADM、ADM-v2 等世界模型论文将推演步长提升到上千步量级,并把世界模型应用到具身智能、汽车运动控制等领域;其自本科起便持续探索机器人科研与工程,曾在国际空中机器人大赛中获得世界亚军。

唐开强任 COO,博士毕业于南京大学,现为南京大学机器人与自动化学院助理研究员,研究方向涵盖机器学习、智能机器人和智能交通,曾以通讯作者身份在 Nature 子刊发表研究成果,首次提出通过多样化的自然行为来提升机器人的敏捷性;其研发的多足仿生机器人获联合国责任创新挑战赛杰出方案奖,并受邀参加日内瓦国际发明展,先后获 CCTV2/10 专访报道。

八年技术积淀:从虚拟环境到具身智能
原方智能的技术路线并非跟风行业热点。从公开可检索的论文记录看,LAMDA 团队在国内最早形成了持续、系统的世界模型研究链条,最早可追溯到 2018 年。以下是团队的关键里程碑:
- 与现代世界模型复兴几乎同期起步
2018 年,《World Models》提出让智能体在模型生成的「梦境」中训练策略,推动现代世界模型研究进入主流。同年,LAMDA 团队公开Virtual-Taobao(arXiv:1805.10000),从真实电商数据中重建虚拟环境,让策略先在模型中学习,再回到真实平台接受检验。
这项工作形成了一条后来贯穿团队研究的主线:从现实中学习世界,在模型中生成经验,用经验训练策略,再回到现实验证。
- 较早关注因果与反事实正确性
2019 年,LAMDA 团队开始研究隐藏混杂因素下的环境重建(arXiv:1907.06584),关注环境模型是否把历史相关性误当成行动的真实效果。此后,团队陆续研究因果结构世界模型、反事实环境模型和可识别世界表征(arXiv:2206.01474、2206.04890、2306.06561)。
这些工作共同回答一个问题:世界模型学到的,是对历史数据的模仿,还是能够支持新行动的世界规律?当世界模型进入机器人、自动驾驶等真实系统,这一区别直接关系到行动的可靠性与安全性。
- 长期研究模型能否真正改善策略
世界模型生成的画面逼真,并不代表它能够帮助机器作出正确决策。单步预测看似准确,也不意味着长程推演不会逐渐偏离现实。
2020 年,LAMDA 团队对环境模型的长程误差进行了理论分析(arXiv:2010.11876)。
此后,又从直接多步预测、奖励一致性、目标策略适配等方向,持续研究如何降低误差累积,以及如何判断模型错误是否真正影响决策。
团队关注的评价标准,也由「下一步预测得准不准」逐渐推进到:
- 能否正确比较不同动作;
- 能否可靠预测奖励与风险;
- 能否在模型中训练出更好的策略;
- 策略回到现实后是否真的得到提升。
这使世界模型不再只是预测工具,而成为策略学习和现实行动之间的桥梁。
- 在世界基础模型浪潮前夜进入规模化具身研究
2024 年 11 月,LAMDA 团队公开WHALE(arXiv:2411.05619),探索可泛化、可扩展的具身世界模型。它尝试从跨任务、跨机器人数据中学习共同的世界规律,同时处理策略变化、长程误差和虚拟经验可信度等问题。
随后,国际上 Cosmos、V-JEPA 2、Genie 3 等世界基础模型集中出现,世界模型加速走向物理 AI。WHALE 的公开时间表明,LAMDA 已在这一浪潮集中兴起前进入规模化具身世界模型研究。
团队此后又将世界模型推进到真实机器人场景,研究摄像机视角变化下的稳定表征,并提出「预见」路线:让模型不仅预测未来,还能为长程任务生成和调整中间目标。相关工作包括 RLA、ReLAM 和 Anticipation-VLA(arXiv:2509.05545、2509.22402、2605.01772)。
- 2026:打通世界模型驱动 VLA 策略训练的全流程
2026 年,团队进一步提出 VLA-MBPO(arXiv:2603.20607),尝试在交互式世界模型中训练视觉 — 语言 — 动作模型。
在这套流程中,真实机器人数据首先用于建立世界模型;策略在模型中尝试动作,模型预测相应后果并生成虚拟经验;这些经验再用于改进策略,改进后的策略最终回到真实机器人上接受检验。
团队还提出面向具身决策的世界模型评价框架(arXiv:2606.15032),强调评价世界模型不能只看视频是否逼真,更要看它能否正确预测动作后果、支持长程规划,并真正改善现实任务表现。

从实验室走向物理世界
原方智能的成立,意味着这条路线开始进一步走向开放物理世界。公司提出的三道关卡,也可以在 LAMDA 团队过去的研究中找到对应:
- 少量经验,对应虚拟环境、离线强化学习、模型生成经验和世界模型中的策略训练;
- 形成信念,对应部分可观测环境、因果结构、反事实泛化、可识别表征和不确定性估计;
- 相融行动,对应长程预见、VLA-MBPO 和真实车辆制动。
正如启动宣言所写:让有限经验生长出对世界的理解,让世界模型形成机器的信念,让机器智慧在现实中持续进化。