小天才开麦:00后,走向世界,走向端侧,走向算力,走向太空 | 甲子光年

栏目:互联网 | 来源:甲子光年 | 2026-09-30 16:59

00后视角的AI下一站。

作者|刘亚琼

内容支持|甲子Builders罗著、王修齐、田琬琦

AI正在经历急速“远行”。

当智能进入物理世界,难度逐层升级:模型不仅要“知道”,还要理解环境、处理变化,并在行动之后获得反馈。

2026年9月12日,以“未来此刻”为主题的2026崇礼论坛在崇礼·太舞小镇举行。本次论坛由太舞小镇、甲子光年、破圈文化联合主办,参会嘉宾及观众超过700人。在开幕式“小天才开麦”环节,甲子光年创始人&CEO张一甲与逆矩阵科技创始人&CRO陈博远、明体科技创始人兼北京邮电大学副教授徐梦炜、MirroS创始人&CEO刘芳甫、万格智元创始人&CEO王冠博、共绩科技创始人&CEO付智共同展开了一场关于《下一站:世界》的讨论。

主题里的“世界”有两层含义:一层是世界模型(World Model),AI如何理解、预测世界,陈博远、刘芳甫的创业均与此有关;另一层是真实世界(Real World),AI正走进我们的电脑、端侧、机器人,甚至太空,这是一场伴随算力基建和智能普惠的星辰大海,王冠博、付智、徐梦炜的创业方向正在于此。

“小天才”们路径不同,但都指向同一个命题范畴:真实世界从来不是一本已经写完的书,它不断变化,充满噪声,也充满未知。你必须去感知、进入、改变它,并承担它给你的反馈。我们的话题就从这里出发。

以下为本场开麦的文字实录,经「甲子光年」编辑,在不改变原意的基础上略有删改。

1. 8个判断题,叩问AI下一站

张一甲:台上只有我和梦炜是90后,其他四位全是00后——博远2004年出生,22岁的独角兽创始人;芳甫2001年;冠博2000年;付智2000年。非常开心可以把大家聚在这样一个场域。

大家每个人手边都有我们的小道具——Yes和No牌、白板、表情包,大家可以举牌“大胆开麦”,表示我有话说,可以直接拿到发言权,也可以举牌“等等”,来打断、追问甚至质疑在场任何一位嘉宾。

今天主题叫《下一站:世界》。在座几位,有两位在做世界模型,剩下几位在把AI送进真实世界,有把智能送到端,有做算力调度系统,还有把智能送上太空。所以我们取了这样一个名字,也想听听各位对于“世界”的态度。

请每位嘉宾先做个自我介绍。

徐梦炜:扎心了,我是90后,目前是北京邮电大学的老师,也正在做太空具身智能创业。我之前在北大读了9年,完成了本科和博士阶段的学习。今天现场看到很多北大师兄,特别亲切。简单来说,明体科技希望通过具身智能技术帮助人类探索和开发宇宙,成为未来星际大航海时代的劳动力提供者。

付智:大家好,我是共绩科技CEO付智。我们致力于构建跨域全球的分布式算力网络。这源于我们的一个观点:未来算力需求会分层,而分布式的小型算力集群在推理上会发挥一定的优势,因此需要相应的网络进行调度。这件事我们已经做了一段时间,目前国家也在建算力网,我们也是其中重要的建设单位。

陈博远:大家好,我是陈博远,逆矩阵联合创始人。我们在做面向真实物理世界的通用世界基座模型,我们相信,AI一定会从虚拟世界走向真实物理世界,但真实物理世界对速度、精度和泛化性都有更为急切的要求,并且真实物理世界是充满噪音的。我们希望构建这样一个基座模型,让它能应用到不同的具身本体,并且作为不同严肃工业仿真的底层引擎,带来人工智能生产力的进步。

虽然我年龄相对比较小,但我们公司凝聚了一批来自国内外大厂的核心技术负责人,也有北大、清华的优秀人才。物理AI绝对不是一两个“小天才”能够做出来的,一定是一个系统性的工程,所以我们也希望能够和优秀的同行一同前进,推动物理AI实现。

刘芳甫:大家好,我是MirroS创始人兼CEO。MirroS希望构建一个能够动态适应物理世界的通用模型。我们现在看到大量的模型,哪怕GPT-6 Astra出来之后,仍然是在静态沙盒里去Scaling up的Static Model。但真实世界是动态变化的,所以我们希望能够做一个在真实物理世界持续evolve、自进化,并动态适应真实世界变化的通用智能模型。我们的愿景,是让MirroS的Reasoning Model连接每一个Physical Sensor,让感知不止于信号的采集,更能通向对物理世界的理解、推演与交互。

王冠博:大家好,我是王冠博,万格智元创始人。我们主要聚焦端侧,希望打造端侧的基础算力设施。我们认为未来云端算力将会持续短缺,在有限的算力下怎么实现全民普惠,将关系到几点:一是成本,二是性能。未来应该是一个多元系统共生的时代。端侧有点像新一代的网络。所以我们希望把云端大模型做在端侧,而不是做端侧小模型,即从过去以流量为核心的时代,转化到以Token为核心的时代,并让它走进千家万户,让每家每户能无限量且免费使用Token以解决自己的需求。这种方式既能满足大家对于智能未来的需求,也能满足大家对成本和用量的需求。

张一甲:我想做一些互动,我说几句判断句,每句话请大家举牌“YES”或者“NO”。第一个判断句——“未来一年,物理AI会出现GPT时刻。”请举牌。

注:刘芳甫举“YES”,其余人举“NO”。

张一甲:芳甫,你是唯一一个给“YES”的,请解释一下。

MirroS创始人&CEO刘芳甫

刘芳甫:我觉得,很多时候所谓的“GPT时刻”,并不一定意味着智能本身已经发生了多大程度的跃迁,或者已经真正超越了人类。它更像是一个Aha Moment——让所有人第一次清晰地意识到,一种新的能力范式已经出现。

对于具身智能而言,我认为真正的“GPT时刻”,也不会只是出现一个足够惊艳、足够炫酷的Demo。更重要的是,人们第一次真正看到一个模型,能够在物理世界中动态适应任务、环境以及持续发生的变化。

我相信,这样一个能够在真实物理世界中动态完成交互任务的模型,会在明年出现;而我也相信,它会发生在MirroS。

张一甲:物理AI的“GPT时刻”的定义是什么?

刘芳甫:我觉得,它首先应该给大家一种很强的“推背感”——让人突然意识到,我们距离AI真正进入物理世界,已经没有想象中那么远了。

这种时刻带来的应该是一种非常明确的惊喜:你看到的不再是一个又一个同质化的Demo,而是第一次真正感受到,AI开始具备进入真实世界、理解环境并参与其中的能力。

张一甲:博远怎么看?

逆矩阵科技创始人&CRO陈博远

陈博远:我投的“NO”,因为我觉得对于“GPT时刻”的定义,大家应该都很明确。第一,它作为一个物理AI的基模,能够有持续Scaling的表现;第二,一定要应用到真实物理世界,无论是工业场景还是家庭场景。如果讲到对于这样一个物理AI的追求,我认为一个通用的物理智能,我们对它的期望应该是它在任意的场景下都能完成任意任务。比如今天这个会场是我第一次来,它非常嘈杂,但如果派一个机器人过来能够帮我完成会务的工作,包括在实际的工厂里,一定充满了噪音和不可见的约束。

我自己对于物理AI基座模型的要求比较高。我认为它可能不会一年那么快,但基本也会在18到24个月,也就是一年半到两年的时间会到来。因为我们发现,对于物理AI基模迭代,除了模型本身范式收敛外,还有一个很关键的问题,就是要把模型应用到真实的物理世界里,在真实的本体或者API Source上进行大规模迭代。所以硬件的收敛速度和数据采集的收敛速度,都会影响到基座模型。

作为一家构建基座模型的公司,我们一直在思考:如何采用最好的硬件,率先进入最深的场景和最多样化的场景里,去触达模型的上限。最终,我们希望能够转起来一个数据闭环,用更强的模型跑通更深的场景,获得更有价值的数据,最终解决更多复杂的任务。所以,我对这个“GPT时刻”的判断相对冷静和克制。

付智(举牌“大胆开麦”):我希望大胆开麦。我们做推理和训练相关的基础设施,服务了很多做物理模型或者世界模型的公司,在数据处理和采集场景有一些独到的观察,所以从我们的角度提出一些想法。

共绩科技创始人&CEO付智

首先,我觉得具身智能的“GPT时刻”,这个概念可以比较清晰地定义,并没有那么模糊。它可以有稳定的跨域泛化的能力,以及稳定的零样本推理能力。一方面,从业人士更清楚今天到底是什么样的场景,有很多时候它可能只是在某一个具体的场景里表现出一些泛化能力,就被大家夸大说“GPT时刻来了”,我觉得这是不对的。但从我们的视角来看,可能有一些更加直接的观察。我们服务了5家以上相关领域的公司,帮他们做数据采集、数据处理和清洗。因为我们这种分散式的设备,在数据清洗上效率会很高,目前大部分还是基于视频数据。

我们发现一个非常有趣的现象。

我们问客户:“你一个月大概处理多少T的数据?”有的人说我要几个T就够了,有的人说我要100T,有的人甚至更多。我们就很好奇,为什么同样规模的公司,会产生如此大的需求差距?有的人会说,他需要4K RGB全彩的数据,有的人会说我要双目数据,有的人说必须有深度数据,有的人说黑白就足够了。你会发现,最源头的数据范式定义环节,现在都还处在非常早期的阶段。所以我认为,一年以内就看到真正的“GPT时刻”,可能都是比较乐观的估计。

万格智元创始人&CEO王冠博

王冠博(举牌“大胆开麦”):我也大胆开麦一下,我比较认同付智的观点。即使现在大家认为LLM已经到了一个非常强的阶段,已经到了GPT-6,但因为我们是做端侧设施的,和很多主机厂商、PC厂商、NAS厂商以及和它们的垂类场景打交道,我们发现,即使GPT-6或者GPT-5.5,也很难应用在垂类的聚焦领域里。所以我觉得从现在真正走向应用来看,大概率未来FDE(Forward Deployed Engineer,前线部署工程师)会长期存在,它一定是Model加Harness,在垂类领域中才能发挥价值。

所以如果我们定义“具身GPT时刻”,我也一直在想这个问题,因为我认为具身也是一个很好的端侧场景。这个场景需要模型收敛到什么样的程度,或者说不管是从架构上得到确认,还是在性能上达到什么样的等级,再配合着Harness就能深入到垂类场景,这也是一个值得探讨的话题。

张一甲:芳甫有必要解释一下。

刘芳甫(举牌“等等”):我很同意付智说的。如果我们把希望全部押注在Real data上,那可能“GPT时刻”确实会来的晚一些。如果我们考虑人类数据Scaling的问题,最后的数据量级可能是“人类数量加上机器人数量”,再乘以人类能够用于物理交互的时间。这样来看,我觉得可能也很难像博远刚才说的,在18到24个月之内就取得这样的GPT时刻。但实际上,现在Coding AGI的能力已经非常强了,无论是在Anthropic还是OpenAI,其实内部已经RSI了,它能写出下一代让它迭代更好的Coding。

其实,Coding作为一个世界的Engine,它拥有世界上所有的Knowledge,只是过去这些Knowledge主要存在于一维平面。现在,我们完全有可能通过Diffusion这样的Visualize的方法,以Coding Engine为核心,把很多Knowledge可以distill到真实世界。所以我认为,数据的Scaling会发生得非常快,发生的点不在Real Data上,而是在Virtual Data上,在无数个和真实世界分布无限接近的Sandbox里。

所以我觉得,Coding的加强会大大催生整个多模态和具身领域的发展。我们也在讨论一个观点,就是过去三年,Anthropic押注了Coding,成为了今天万众瞩目的startup。那么未来三年,面向多模态和具身智能,核心范式会是什么?

我们的答案依然是Coding。只不过,它不再只是对文本和软件世界的Coding,而是对感知、物理规律和交互过程的Coding。我们内部把它称为——Multimodal Coding。

张一甲:酷。我们继续。第二个判断句:“未来一年世界模型会出现类似Transformer的统一技术路线。”请举牌。

注:陈博远、刘芳甫、王冠博举牌“YES”,其余人举“NO”。

张一甲:先听两位做世界模型、举牌“Yes”的小伙伴发言。

MirroS创始人&CEO刘芳甫

刘芳甫:我觉得可能未来世界模型的定义,更多是一个“环境”。真实物理世界肯定不是Scaling一个基础模型就可以完成,它是动态变化的系统,既有环境,也有Agent——这个Agent是由基础模型加Harness组成的。

所以,我们要Scaling的不是单一的基础模型,而是整个环境+基础模型的系统,最终我们去实现多模态的智能,整套环境的Scaling就是伴随着Coding的Scaling,进一步催生整个多模态世界的数据。所以未来我觉得最后会收敛到一个词上——多模态Coding。这是我认为极大可能会收敛的一条路线。

陈博远:非常认同。本质上无论是在Sandbox里,还是进入真实物理世界,我们想学好这样一个世界模型,或者物理AI基座模型,一定要不断纠正和反馈。

我想补充一点,我们在谈论这个范式收敛之前,可以先回到第一性原理。比如大模型的成功其实不止是Data Scaling,因为Data Scaling其实已经让Deep Learning成功了。让大模型成功的,其实是我们定义好了基础任务,也就是预测下一个词(Next Token Prediction),虽然非常反直觉,但是我们在信息论上能够bound住,预测下一个词的Predictor,等于一个Compressor,所以大家说“压缩即智慧”。

回到真实物理世界,特别认同刚刚我们说的,Data Scaling不会成为唯一Scaling的轴。因为我们发现,第一,真实物理世界和Virtual world不一样,虚拟世界可以给它定义很好的上下文,是个全观测空间;而真实物理世界是部分可观测的。比如我们现在不需要知道这个场馆的温度、湿度以及重力加速度是多少,但我仍能够拿起这个麦。所以我们人类是在这样一个部分可观测的环境下,完成和物理世界不断交互和决策的过程。

我们还会发现,人类对于物理世界的理解不只来自于“感知更多世界”,不只是看过更多数据。如果我们只是看过更多数据的话,我们一定会认为桌子有吸力,不然为什么所有视频里杯子都在桌子上,没有飞到天花板上。我们对于物理本身的理解,其实是来自于和世界不断交互,我们在交互过程中不断验证和更新假设,比如把杯子放在地上,发现它没有被吸在桌子上。

所以,为什么我坚信,一年之内范式会收敛?包括我们和英伟达、硅谷也有合作,以及内部看到一些Scaling的结论,我们发现在Data和参数之外,在预训练阶段,我们要把交互或者动作因果原生引入模型架构。所以在我们自研的预训练架构上,现在可以看到在更大规模尺寸上,基模涌现出来一些对于物理世界的理解能力,无论是油性材料、流体材料,以及最终应用在不同本体上,都表现出跨本体泛化和零样本泛化的能力。

从国内外进展来看,包括我们在逆矩阵内部看到的Scaling进展,我觉得范式在一年之内会收敛,但一年之内范式能否落地,其实还要靠上下游同行一起努力。比如刚才付智提到,无论是数据,还是应用到真实的端侧,我觉得都是很大的难题。因为你会发现,大模型也经历过一个过程,就是先提高智能,再把智能做到端侧,做到手机上。所以最终物理AI基模一定还是要做到本体上,我觉得这块还有很多的问题要解决。

共绩科技创始人&CEO付智

付智:我为什么Say “NO”,倒不是因为对这个有特别深的认识,相反正是想请教一下大家。我想先抛一个论点,大家可以在这个论点基础上延伸:我认为智能不等于精确。显然,我们在座每个人都是拥有智能的,但这个手牌有多宽,在座没有任何人能够一眼看出来具体几厘米。

在很多传统的工科领域,如果依赖精确的建模,或者采用仿真的方法,其实可以做到精确求解,能够解决相当细分场景的问题。但如果我们追求的是“智能”,我们所说的这种智能,就像人类一样,它也许模糊,但能够对未来进行一些预测,也具备一些泛化和感知的能力,其实我会对此感到疑惑。这也是为什么刚才Say “NO”。

以前的大语言模型是一维的输出,也就是文字。它本身输入信息很多也是一维的,在训练过程中,人对它进行标注,输入了一些逻辑性的东西;但今天我们在做物理AI相关研究的时候,比如视频数据也许包含了二维信息,如果加入了3D几何空间信息来做的话,可能还有三维,或者再加上一些时间轴上的信息,它怎么泛化出物理空间里如此多维的感知?

这其实是我比较疑惑的,于是我Say “NO”,因为我不知道怎么定义数据,以及它们之间的映射关系。

明体科技创始人兼北京邮电大学副教授徐梦炜

徐梦炜:我想解释一下我为什么举“NO”,我们也不是做最前沿的World Model的方向,所以我也是抱着请教的态度。如果提到收敛,可能还得考虑它的终局是什么。从应用角度来看,我感觉终局是“潜空间表征”。但是从潜空间表征上看,刚刚博远说了,它的Scaling不只是模型,还得有一个预训练的方法,语言模型我们有非常明确的预训练范式——也就是预测下一个词(Next Token Prediction)。但在潜空间表征这个方向,尤其是表征训练方式还比较早期。一年内可能可以收敛到一定的状态,能有一定的产出,但可能不一定是终局,这个终局还需要3年、5年、10年的时间才能实现。

张一甲:我们继续。第三个判断句——“未来一年AI的主战场仍然属于基础模型。”请举牌。

注:徐梦炜、付智、王冠博举“NO”,陈博远、刘芳甫举“YES”。

张一甲:请每位举“NO”的嘉宾各说一句。

徐梦炜:我觉得数字世界会有瓶颈,到后面经济效益就没有那么高了,未来可能还是要解决物理世界的问题。

付智:首先,大家都在追求更强的模型智能,但真正到了使用端,其实很多场景并不需要最强的模型。越来越多的需求,可以由能力稍弱一些、但更适合具体场景的模型来解决。我认为,这会是未来一个很值得关注的方向。

万格智元创始人&CEO王冠博

王冠博:用户永远不需要一个最贵的模型,他只需要一个能解决需求的模型。等模型达到用户期待的阈值后,其实大家就要开始追求性价比了。如同Kimi3的爆火,它虽然不是Top1,但因为超过了Claude Opus 4.8,所以大家觉得OK,基本上所有需求都可以被满足了。那接下来大家就会去寻找一个最具性价比的方式,来实现应用场景的落地,同时满足对价格的预期。

张一甲:第四个判断句——“未来一年,端侧AI会成为比云端AI更重要的战场。”请举牌。

注:付智举“NO”,其他人举“YES”。

付智:我并不觉得它们之间有什么重要的区分,如果要区分,比如谁规模更大,谁就更重要,那我觉得还没有那么快。大家关注更多的,还是有很多场景会跑在云端,它依然是更通用的场景。

张一甲:第五个判断句——“太空原生机器人,做起来会比地球上的机器人更简单。”请举牌。

注:徐梦炜、付智、刘芳甫举“YES”,陈博远、王冠博举“NO”。

徐梦炜:和地面相比,太空这个场景有诸多挑战,比如物理规律不一样,可能在太空中碰一下它就会转起来,没有摩擦力很难夹住它;包括在算力层面,太空场景是一个非常典型的端侧算力,不仅算力总量受限,而且散热功耗也受限;最后,在辐射上,可能太空会有一些单粒子反转等问题。

在这些挑战之上,太空有一个好处,它是具身智能的垂直场景,它的环境相对来说比较干净,跟我们的会场和家庭相比,它的任务也相对可以预先定义。所以,太空对具身智能的智能上限,以及对泛化性的极致追求没地面那么高。

我们公司也不像博远他们追求智能上限,更多是用当下的具身智能技术去解决太空里的一些重要问题。所以总结一句话:走进太空比走进工厂要难,但是比走进家庭要简单。

陈博远:非常认同。我要补充一下,太空这个场景现在是没办法触碰到的,所以会有很多挑战。但是相比而言,家庭场景完全是非结构化的,对于泛化性要求很高,千人千户。而太空作为一个垂类产业,只要我们能够攻克一些挑战,反而有可能率先由像明体这样比较优秀的公司,实现一些落地应用。

张一甲:SpaceX上市,马斯克第一次让大家看到太空经济是可以部分商业化的。梦炜,马斯克和你的愿景,有没有基础假设是不同的?

徐梦炜:其实差不多,最终就是大家希望的,都是走进深空。在这个过程中,人类是很脆弱的,需要机器人的陪伴和帮助,所以大家的愿景是一样的。只不过马斯克是特别垂直整合,什么都做;而国内的产业链分工还是比较明确的。这是商业化上比较大的区别。

张一甲:第六个判断句——“十年后,算力会像电力一样便宜。”请举牌。

注:陈博远举牌中立,其他人举牌YES。

陈博远:我觉得这个东西很难预测,因为算力有很多种,有云端的,也有端侧的。所以在这个事情上,还是得靠在座优秀的同行们一起推进。它一定会成为核心卡点和里程碑,但是价格受到多方面的约束,比如模型能力、智能上限、应用市场等等,所以不像电力一那么好预测。这是我保持中立的观点。

王冠博:就像刚刚博远说的,未来算力怎么定义,也是一个问题。如果我们还是以GPU集群来定义算力,以它的功耗来看,价格可能还是居高不下的。但现在出现了很多新的SoC,不管是存算一体芯片或者新一代的NPU,它是专门为计算而生的,功耗可以做得非常低,带宽可以拉得非常高。比如我们国内一些头部的3D DRAM厂商,带宽可以拉到2T,功耗只有10W。如果把它推广开来生产Token的话,算力成本一定便宜很多。但如果未来算力依然是个GPU主流的市场,那可能价格也要见仁见智了。

徐梦炜:我说一个大胆的。我们的产业链里有一个比较重要的场景,就是太空数据中心。理论上,可能20年、30年以后算力会比电力更便宜,因为在太空不需要用地面上的电力,但这个会需要比较久的时间。

张一甲:第七个判断句——“未来一年,具身智能会在家庭场景成为刚需。”请举牌。

注:所有人都举牌NO。

张一甲:唯一一个共识。

陈博远(举牌“大胆开麦”):我要大胆开麦,刚刚我犹豫了一下,我原来也想具身智能会不会大规模铺开。但在这个过程中,除了技术之外,还有很多安全和隐私的问题,这些其实都会影响具身智能能不能在家庭场景里大规模铺开。

如果问题是具身是不是家庭的真需求,我觉得这个真需求是一直存在的,并不是说到了某一个时间点才突然出现。比如养老、幼儿照顾都是家庭场景里长期存在的真需求,我们也面临着一些老龄化的问题。只是技术能不能供大于需,以及能不能解决一些安全和隐私的问题,这是挑战,这也是为什么我刚刚犹豫了一下,最后又举了一个“NO”。

张一甲:第八个判断句——“未来一年AI遇到没见过的任务,人类只需要说要什么,不需要说怎么做。”请举牌。

注:陈博远、刘芳甫举YES,付智举NO,徐梦炜、王冠博中立。

张一甲:这个问题依然有分歧。

徐梦炜:这个问题相对宽泛一点,没有限定数字世界还是物理世界,我觉得都可以,我觉得在文字状态空间可能都是能做到的。

付智:如果在文字状态空间里,可能是能做到的,但是可能只能覆盖大部分问题中的极小一部分。对于很多人来说,真正的问题都不发生在文字状态空间。

陈博远:我觉得虚拟世界里AGI已经实现了。大家可以在Virtual或者Computer Use的情况下,让AI帮助你完成很多任务,帮你很快地探索,甚至可以操纵机械臂。但是为什么要这么做,从哪个方向做探索?这些最宝贵的idea还是来自于人,本质上AI可能只能完成人类70%到90%的反应,剩下的10%,还是得靠人的智慧来归纳偏置(inductive bias)。

张一甲:今天的主题为《下一站:世界》,我们正在描绘这样一个图景:AI正在向真实的、开放的、未知的世界中自主学习、适应和行动,并且正在走向机器人、走向端、走向太空。如果把这个蓝图的大目标假设为100公里,你认为我们已经走到了多少里程?请各位嘉宾分别在白板上写下里程数(0-100)。

注:徐梦炜写“5”,付智写“10”,陈博远写“5”,刘芳甫写“60”,王冠博写“85”。

张一甲:大家的分数差异好大。从分数最高的开始说说吧。

王冠博:我想先限定一个场景。以LLM为例,尤其是Coding类的任务,为什么我觉得还剩15公里?因为Coding确实可以打一个基建,但是它不能干所有的事情。尤其是在很多垂类场景下,一定还是需要结合具体场景的需求,不管是具体功能,还是CLI,才能真正把事情做起来。所以即使具备了自进化的能力,也很难突破最后1公里,甚至10公里。如果把它上升到未来的多模态实践,其实我们距离真正的目标还有一些距离。

张一甲:如果用一句话来概括,最后的15公里和前面的85公里,它们的难度系数大概是什么样的?

王冠博:我觉得前面85公里的难度应该是0到1的难度,但是最后15公里的落地,应该是1到99。

刘芳甫:我觉得,60分是一个Warm-up的分数——至少已经及格了。

过去,无论是仿真器还是Physical Sensor,很多系统本质上都依赖传统的Rule-based逻辑。今天,AI正在把这套范式逐渐转向Reasoning-based Model。这意味着我们已经不再只是为每一个场景预设规则,而是在向更强的泛化性、通用性和开放性迈进。从这个意义上说,我愿意给现阶段AI的发展进程打60分。

但剩下的40分,可能比前面的60分更难。

就像刚才冠博提到的,最后一公里可能仍然是FDE。随着RSI不断发展,AI会越来越深入地进入真实物理世界,与人持续交互,并真正参与到具体任务之中。到了那个阶段,它面对的就不再只是已知问题,而是不断进入未知场景、处理新的变量和新的分布。

所以越接近真实世界,问题可能反而会变得越难。剩下的40分,并不是简单把已有能力继续Scaling Up,而是让智能真正学会在一个开放、动态、充满未知的世界里持续工作。

张一甲:我发现芳甫你是一位挺激进的同学,刚刚“GPT时刻在一年内发生”,以及现在的“60公里”都是非常激进的判断。当然,芳甫的公开报道很少,我可以和观众们说明一下,芳甫很厉害,他两度获得清华大学国家奖学金,也曾经是NVIDIA世界模型核心一作,所以观众们可以关注一下芳甫的观点。

当然,博远今年本科毕业于北京大学元培学院,拿过ACL2025最佳论文,也获得过北大学生最高荣誉“五四奖章”,论文引用2800余次。你的判断是5公里,为什么?

陈博远:大家心中物理AI的终极目标,就是通用智能能够进入到任意场景,无论受到任意噪音干扰,它都能完成任意任务。我们现在看到,虚拟世界的问题已经被解决了,但是Virtual World到Reality,再到真实的Application Setting之间,还有很大的差距。我们看到现在很多物理AI非常fancy的Demo,其实都在一些受控的场景里,但是真实物理世界是充满噪音的,比如说我们去徐工、中车这种真实工厂,或者真实家庭里面去看,很多边缘情况不是长尾,它一定是常态的。所以大概率我们让物理AI在真实场景里完成任务时,在预训练数据分布里出现的概率可能都趋近于0。

这就带来了两个问题。第一是怎么样通过一个足够好的预训练范式和基座模型,把真实物理世界里充满噪音的数据提炼、抽象出来。比如我们真正希望学习到的是一些物理的结构性规律,人类掌握的是物理直觉和本能。比如这个话筒如果松手可能会掉,这个可以在各个场景之间泛化。所以我们需要找到这样一种能够学习物理规律的范式。

第二就是一定要进入到真实的场景,这个真实场景不代表是一个受控的Sandbox,也不是摆好的实验台,而应该是真实的工业、家庭,以及更多真实需求场景,并且在这些场景里完成数据回流和闭环。

为什么我认为它是5公里?因为我觉得如果把它比作一个100公里的马拉松,那Demo还是鸣枪的阶段,真正物理AI的基模范式,以及真实世界的闭环还有很长的路要走,这也是逆矩阵希望解决的核心问题。

2.谁是10年后物理AI的世界Top3?

张一甲:世界模型是今年最热的一个词,它是整体的大共识和所有细节的非共识。请博远和芳甫分别描绘一下,你们心中世界模型是什么样的版图,你们在其中扮演什么身位?

陈博远:我们刚刚一直在说物理AI的第一性原理,其实是在说这样一个通用的物理智能。我们想做个类比,自动驾驶会有L0到L5的分级,根据车的自动化系统的逐步完善来定义,每类分级最终解决的是不同应用场景的问题。

所以我们也在思考,从第一性原理出发,从世界模型的应用场景,内部认为会有一个W0到W5的分级:

W0的模型主要是一些视觉模型,比如说现在看到一些视频生成模型,或者3D Construction Model,能够解决游戏场景,包括一些稳定工业场景里对3D资产的需求,它能够生成稳定的视觉内容,但是很难把它应用到物理上;W1的模型,其实就是能够响应动作,比如说一些游戏交互的世界模型,但并不理解动作的物理后果;我认为一个关键技术点是W2的模型,我们会发现,对于真实具身的灵巧操作、严肃工业仿真,以及对于未来可能会遇到的科学预测,首先要理解的不是“怎么样生成一个视觉逼真的世界”,而是首先理解物理正确性。

所以从W1到W2的阶跃,就像自动驾驶从L2到L3的阶跃一样。我们是希望构建这样一个W2的模型,首先解决物理正确性、物理直觉和本能。

当然,这个分级不是说我们要给同行做一个归类,而是我们内部也在梳理:什么样的技术在解决什么样的真需求和真问题,每类真需求和真问题一定都是有价值和意义的。

我们希望,未来W5是世界模型进入太空,可能会发现一些连人类都没办法理解的物理规律。既然它能够学会物理,就能够学会我们理解物理世界的方式,可能也会做一些AI for AI,AI for Science的预测,并且发现一些新的规律。当然,这是我们对于未来物理AGI的理想和愿景。

刘芳甫:我们跟大家谈的世界模型有一个比较大的不同,我们认为下一代的核心词汇不再是预训练,可能是Continual Learning,或者Learning from Experience,从经验中学习。

就像刚刚谈到的,为什么我们说基模仍然是重要的,而且需要追逐的。这里定义的基模,并不是一定要极度智能、能够解决千禧年问题、能够做科学问题的模型,而是一个足够通用的模型,放到所有的Physical Sensor上都可以工作,都能够成为一个Warm-up的起点。

我们认为,未来物理世界的模型一定不是一个最高质量的Astra Model,而是一个能够动态适应场景、任务和环境变化的模型。相当于拿着一个杯子去装水,具体装什么水,取决于这个环境的内容和环境复杂度。

比如现在大家都在谈灵巧手。如果灵巧手上运行的是一个能够在推理过程中持续进化和更新的Reasoning Model,那么它面对的就不仅仅是“出厂时”的那一套状态。真实硬件是会变化的:触觉传感器会漂移,电机会磨损,机械结构也会随着使用发生变化。模型与Hardware Harness之间的匹配关系,本身就是动态的。

所以我们认为,未来通用的基础模型在物理世界里就是一个Dynamic的EvolvingModel。

在我们看来,世界模型更多的不是一个目的,是一个过程。大家谈持续学习(Continual Learning)也好,从经验中学习(Learning from experience)也好,其实跟我的模型架构没什么太大的关系。持续学习的本质,是要找到一个可持续学习的环境,所以我们会把世界模型看成是训练这样一个基础模型的环境。但是最后我们去部署在各个场景里的模型,一定还是一个通用的、动态的智能模型。

张一甲:大家认为物理AI这个大范畴,十年之后会形成的生态格局里,Top3的企业可能是哪三家?

徐梦炜:台上两家加上SpaceX。

张一甲:你呢?

徐梦炜:我们不是专门做机器人的,我们是做场景的。

付智:我觉得还未可知,说不定这样的公司还没有出现,如果高情商发言,就是台上的两家。

陈博远:我相信逆矩阵肯定会是一家。我对于自动驾驶、大模型时代,包括物理AI时代的一个核心看法是:每个时代周期里,首先上一代的时代周期大厂会留下来,比如说BAT、OpenAI这是一类,因为他们有更强的资源,很多RSI的东西都是自己来做。

第二类,是这个时代周期出来的新兴初创公司。他们掌握着更快的加速度和速度,掌握着基模训练能力,以及把它部署到真实场景,形成Physical RSI闭环的能力。比如说上一波大模型阶段的DeepSeek、Kimi、智谱、MiniMax,它们到这波时代可能变成新时代定义下的大厂;另一部分是新时代阶段如世界模型出现的新初创公司,我相信逆矩阵会是其中一家。

刘芳甫:如果未来真的会有三家公司走到最后,我更关心的其实不是它们分别做出了什么技术,而是它们最终选择把技术带向哪里。

今天这个时代,大多数做AI的人,还是在不断追逐技术上的高峰、突破和那种很强的“爽点”。这些当然重要,但我希望真正走到最后的公司,最终都能够回到一个更本质的主题——AI for Human。

AI的终局,不应该是让人类花更多时间去适应机器,而应该是把人从越来越多机械、重复和消耗性的事情中解放出来,让人重新拥有时间去生活,去感受、体验,也去分享这个世界。

所以在我看来,一个真正好的World Model,或者真正好的多模态智能,最终应该成为一种对生活的放大器。它不是让人离真实世界越来越远,而是让那些愿意体验生活、享受生活、分享生活的人,获得更多进入世界、感受世界的可能。

未来无论是哪三家公司,只要它们最终能够把这样的价值传递给更多人,在我心目中,它们就是值得走到最后的公司。

王冠博:创始人还是需要有极强的信念感。像刚刚博远相信逆矩阵,我们愿意相信相信的相信。因为这个大的前提是基于未来世界模型的发展,所以除了台上两家之外,我们也期待未来世界模型可能会诞生一家类似于DeepSeek这样的公司,能够把整个模型的架构定义下来,产生第一次“GPT时刻”,可以供其它下游的应用验证,这样才能够更好地实现所谓的数据飞轮以及场景飞轮。

张一甲:付智和冠博,你们两个做的事情之间还是有一点关系的,都是关于怎么样让算力变得更加普惠,可不可以再多分享一下你们做的事?

付智:其实我还停留在上一个问题。您问的问题是十年之后,我觉得十年之后留下的一定是今天开始、且在以十年为尺度做这个工作的人。今天这个行业和赛道很热,尤其资本很狂热,很多人在为明年、后年做努力的,而不是为了十年后做努力。

回到您刚才的问题,这是我第二次创业。第一次创业是2021年,那时候才大三,当时元宇宙很火,我们尝试用它生成游戏,但今天看来简直不可能实现。我觉得现在大家对很多东西的追求,也容易陷入这样的陷阱。今天已经没人提元宇宙了,但是过几年之后,可能也就没有人再去提今天的事情了,所以还需要清醒地看待。

上一次创业之后,我最重要的认识就是要看得更远一些。所以从三年前开始,我们就专注给AI推理需求做灵活的调度。原因很简单:

第一,推理需求未来一定会分层,并不是所有的模型、所有的需求都会跑在最尖端的模型上;

第二,只有最顶尖的大模型才有资格闭源。所以大部分满足需求场景的这些模型可能是开源的。也就是说谁都可以拿它去部署,它具有一个分散部署的基础;

第三,就是推理的基础设施。就像冠博做端侧,我们可能关注是一些分散的小节点。你会发现,超级大的集群和很端侧的设备,或者一些中小的节点,它在性能上并没有绝对的什么选择。除非是那种最强的模型,你非得跑在B300的集群上,但我刚才说的中间那一批几十B到百B级别的模型,可能再小一点的在端侧,有一些可能用小集群就跑了。

我们公司前一段时间做了一个事,我们在8台英伟达比较领先的显卡上,能做到跑GLM-5.3,能做到1.5亿的TPM,服务了很多人。我们回到现实世界看,中国能建万卡集群的资源、场地、资金、人,都是凤毛麟角的。但中国能建百卡集群的人比比皆是。或者说,今天的资本不敢投万卡集群,但想跃跃欲试进入小集群场景的人到处都是。

同样,现实世界具备分布式基础设施的基础,需求侧又具备分散部署的基础,需求侧会分散,供给侧会分散,至少会存在这么一个空间,中间一定需要一个调度平台,所以我们就做这件事,构建最大的分布式算力网络。

王冠博:我接着付智的话补充一下,就像刚刚我们提到了未来到底需要什么?如果从技术层面,可能今年讨论的问题明年已经不再有热度了。但我觉得从需求侧出发,用户永远需要最终的性能和体验。如果以满足需求为导向,是成本和价格,所以大家现在在集群侧搞高并行,搞组网调度,核心也是为了降本和更高速地服务于AI使用。而端侧的核心,希望能够把云端的算力,在满足用户智能需求情况下进行低成本部署,从而满足大家未来长时间、无限量使用AI的需求。

这里可以举一个简单的例子。我喜欢拿流量来对比,过去整个流量时代,大家可能用4G、5G,家里可能使用Wifi。现在AI的Token,我觉得是新一代的网络。如何让Token像过去的流量一样,真正嵌入到每个家庭里生产生活中,它应该是一套端云一体化协同的方式。云端可能有大基建,有点像过去运营商做的方式,中间可能有边缘节点,像付智做的整体调度,端侧也有家庭的路由器,来满足大家对WIfi长时间的使用,而我们就是做的是Token界的Wifi。

3.“功成不必在我,功成必定有我”

张一甲:刚才说了很多技术,最后我们把技术先忘掉,我想聊聊这一代人。今天来了非常多的AI Builders,有的可能是OPC,有的可能在创业,有的已经拿了钱,也有的融了非常多钱,只不过没有上台。

我想问的是,今天你们怎么看待这个时代以及你们自己的机会——是什么让你们可以肩挑这么大的事?如果有一个刚毕业的年轻人,他有什么样的机会和禀赋时,可以选择做Next Big Thing,而在什么情况下,他应该是做一个小而美的自我实现的事?

徐梦炜:第一个问题,我们的机会哪里来,我觉得确实赶上了好时候。对我来说,我的背景特别简单,一直在高校读书,读完书之后来高校当老师,一直做一些科研方面的工作。这次我们想创业,一个底层的机会就是来自于国家层面的支持,包括对硬科技的支持,包括国家提供很多的资金进入地方市场各种基金,以及通过教育部的渠道告诉高校,这些老师的成果就是应该被转化的。我觉得这是我们最大的底气。

张一甲:在这个大的picture里,why you,为什么是你?

徐梦炜:我觉得是我,就可以是我。

付智:我觉得这里可以分多个维度。

首先,未来主义的趋势又重新进入大家的视野,这是非常好的一件事。我们从小到大看了很多科幻,还有一些对于科技世界想象的书。但在过去10年,或者再往前一段时间,至少在中国,大家对于未来的畅想停滞了,或者大家很多时候在往虚拟世界跑,比如短视频之类的空间,而不是在想怎么用科技让这个世界变得更美好。而这种叙事从过去几年到现在,重新回到了大家主流的叙事中,所以引起了全世界的关注。这是第一个也是最大的点。

第二,科技一定是下一个最重要的高点。而我们身处其中,既获得了这样的机会,当然也承担了一部分责任。

第三,今天很多资本市场或者媒体等等,从短期热潮中获取了收益,于是投入了更大的热情到其中,又给我们带来了一个短期高峰,但这个周期存在波动。

回到我前面说的,最重要的是“人类对于科技让世界变得更美好的想象”,它永远会存在。只是有时候它是主流叙事,有时候也许不是,有时候也许是环保或者别的。再到国家的竞争,也总是存在的,但资本短期的热情是偶尔会波动的。

逆矩阵科技创始人&CRO陈博远

陈博远:讲一下我的感受,我觉得首先一个很大的感受,这波AI技术本身加快了我们对于技术的了解,以及技术的普惠。我们现在取得的一些探索和成就,一定是站在过往整个人类社会技术共同体之上。比如拿人工智能发展来说,出现了Transformer、Scaling law、基模、RSI和闭环,我们believe in这件事。

第二,创业本身是从0到1,以及不受桎梏的过程。我不想把物理AI定义成一个“小天才的时代”,或者某一个年龄段的人的时代。我觉得这个时代下,创新本身的第一性原理是不受过往经验路径依赖的,或者说要摆脱这种路径依赖。像我们公司原来可能在北大、清华还没有毕业的同学,也有一些拿到了OpenAI、Apple,包括国内外大厂千万级的Offer。

但其实大家都会觉得有两个事情:

第一,很多技术第一性原理还没有被解决。2025年的时候,如果那时候我们想要出来去大厂拿高薪,包括创业选择那时候比较热门的方向,比如Agent或者强推理也好,估计也能赚到不少钱,但我觉得,这不是我们逆矩阵想要解决的问题。我觉得随着AI的发展,一定有一些第一性原理问题还没有被解决。以及资本市场有冷有热,但我觉得作为技术本身是要冷静下来的;

第二点我觉得也比较关键。在过往我们和硅谷英伟达的交流讨论,包括一些项目合作,大家并没有感觉到像上一个时代一样,我们在跟随国外。反而是很多我们的技术成果,国外一些大家看起来非常牛的同行,也会觉得Aha Moment,也会Impressive,并且实际用到他们的技术产品里,这是我们的一个信心。反过来说,为什么在这个物理AI时代,我们这代人依然还要跟随国外?不是的,我们有能力代表中国团队做出来全球领先的AI。现在凝聚了这样一帮海内外不同的工程师,凝聚了一些所谓的“小天才”,但是我们真正希望解决的是第一性原理技术,以及能够让物理AI真正服务到千家万户。

刘芳甫:我们的出发点也有类似的地方。我觉得这代年轻人很重要的地方,就是有活力、有想象力、敢于定义事情。举个例子,可能Coding AGI更像是一个小孩,在一个关上门的黑屋子里,看着电脑屏幕不断地学习,最后获得了一个超强能力。但是当这个小孩推开门,走向一个多姿多彩、充满颜色、充满意外的世界时,又会发生什么?可能北美没有那么多的场景,最多场景其实是在中国。上一代Coding的赢家确实是Anthropic和OpenAI,但是我觉得这代年轻人有责任去扛起物理AI的大旗,去定义一些事情,并且代表中国去引领整个世界,走向最后的物理通用的GPT Moment。这是我们出发的初心。

王冠博:当下和之前的创业环境最大的不一样,是我们真正从之前的模式创新,转变到了以技术驱动为导向。倒不是说技术掌握力就在这帮年轻人手里,而是大家面对未来,面对效益和效果,以及那些充满机会和挑战的事情,真的有一个自己能够够得着、能够去突破的愿景。

从我们的视角来看,我们是希望能够共建这样一个新一代的价值观。在过去,大家的思维还是偏向稳定,尤其像互联网就业的那波。但在以技术为驱动的时代,每个人都会觉得,自己真的可以有机会定义一个场景中的未来通用解决范式,不仅能够造福我们自己的国家,甚至造福全球的人类。

第二是为什么要创业,本质上是价值获得感的来源,不管是工作、读书,总归是希望让你的情感价值和精神价值能够不断提升,但在创业过程中,你在解决问题、克服问题,虽然会感到疲惫,但内心是充裕的,精神世界是饱满的。你就愿意为这个事情付出一生的努力。

张一甲:最后请大家拿出桌子上的“车票通行证”,给自己定一个目的地,然后写下到达日期。不限目的和周期。每个人一句话。

徐梦炜:我的目的地是火星,2050年。目标是在退休前能到达火星。

付智:我写的目的地是宇宙深空,我认为宇宙是未知之源,也是人类前进的一切动力,并且宇宙足够广阔。我写的周期是anytime,也许有生之年实现不了,但无所谓,功成不必在我。

逆矩阵科技创始人&CRO陈博远

陈博远:我写的是“物理AGI”,到达日期是十年。我觉得对于一个公司来说3到5年很快就会有结果,但对于技术本身来说是需要用10年乃至更长时间来解决的。我们希望10年之后依然充满热情、充满活力,和大家一起去实现物理AGI。

MirroS创始人&CEO刘芳甫

刘芳甫:我写的目的地是“生活”。我们希望未来物理AGI实现之后,最终迈向的窗口可能就是我去车里体验生活,去自然里体验生活,去KTV里唱歌。这个才是大家推动AI发展的初心——能够有更多的时间陪伴家人,去享受自然,这是AI最美好的地方。希望这个时刻能够10年后实现。功成不必在我,但功成必定有我。

王冠博:我写的是“端侧AGI”,时间是2028年。希望给28岁的自己送一份生日礼物。

张一甲:很酷。功成不必在我、功成必定有我、给自己28岁的生日礼物……这些答案很少出现在其他的圆桌上。在刚刚聊的过程中,我突然认为《下一站:世界》这个主题还有第三层含义。最开始,我们说这场圆桌聊的是世界模型,以及AI走向真实世界,但不仅仅如此,台上是这个时代最有生命力、最有增长力的一代人,他们的话语体系一开始就是“世界”,不是中国的第一,是世界的SOTA、宇宙的未来。这代人的底色是要定义下一代范式。也许他们会成功,也许过程中会存在泡沫,也许功成不必在我,也许未来Top3的企业有两、三家就在今天的舞台上。但今天的分享只是一个开始。我们论坛的主题叫“未来此刻”,我们可以把这个圆桌的主题从《下一站:世界》改成《世界此刻》。今天的圆桌就到这里,谢谢各位!

(封面图及文中配图来源:2026甲子光年崇礼论坛)

了解更多

猜你想看

← 返回首页