
新智元报道

上周,一家名叫Dyna Robotics的公司干了件让整个行业集体失眠的事。
他们训练了一个叫做DYNA-2的模型。独特之处在于,预训练阶段一条机器人动作数据都没喂。
取而代之的是,他们给模型灌进了超过 100 万个小时的人类第一视角视频。相当于一个人连续学习 170 年。
结果,从 1000 小时一路到 100 万小时,每翻 10 倍机器人都在变聪明。更准确地说,是一条持续上升、没有明显撞墙的幂律趋势。
可以说,物理AI终于有自己的Scaling Law!
消息一出,行业炸了。因为这等于宣告:训练机器人最稀缺的资源,不是GPU、不是算法,而是高质量的人类行为视频数据。
谁手里有这批数据,谁就掌握了物理AI时代的石油。
但问题随之而来。这条曲线都看得见,但跑到关键拐点需要的那批数据,却都锁在各家公司自己的硬盘里。
直到这家公司把锁撬开了。
8月20日上午,在2026世界机器人大会(WRC 2026)上,光轮智能宣布:10万小时全模态人类行为数据,全部开源!
数据集叫EgoSuite-Open100K,与Hugging Face联合发布,首批已上线Hugging Face Hub和AtomGit。学术研究能用,商业训练也能用。

开源网页:https://egosuite100k.lightwheel.ai/
官方新闻稿:https://lightwheel.ai/media/egosuite-open100k
HF 开源仓库:https://huggingface.co/collections/LightwheelAI/egosuite-open100k
迄今为止,全球规模最大的全标注开源第一人称人类数据集,具身智能最贵的资产,今天第一次被摆到了所有人都能够到的桌面上。
消息发布后,X 上迅速炸了。
最先炸的是 Hugging Face 自己。HF 官方账号直接转发了光轮智能的发布帖。

熟悉这个全球最大开源 AI 社区的都清楚,HF 官号几乎从不单独为某一个第三方项目公开站台。
翻遍 HF 官号的历史,能找到的类似操作屈指可数:IBM 和 NASA 联合发布的太阳物理模型 Surya;Databricks 的 CommonCanvas 图文数据集,官号称其为「Hub 上托管过的最大数据集」;图像生成模型 Flux.2-dev。每一个都是各自赛道的标志性开源事件。



EgoSuite-Open100K 这次拿到的待遇,跟它们一个级别。
不止官号。HF 旗下的机器人项目 LeRobot 更是直接发了一条长帖力挺,明确表态:「Always great to see a dataset at this scale released openly on the Hub.」
机器人领域大 v 博主 Lukas Ziegler 随后跟进,详细解读了数据集的多视角变体,称这是「训练灵巧操作不可多得的素材」。


新加坡国立大学助理教授Jiafei Duan表示:开源是新的护城河

为啥偏偏是10万小时?
这个数字背后是过去一年物理AI领域一系列硬碰硬的研究结论。
英伟达2026年发布的EgoScale框架,用20,854小时的第一视角人类视频训练VLA模型,第一次在具身智能领域画出了一条清晰的对数线性扩展曲线——人类数据小时数与验证损失呈对数线性关系,R² = 0.998,在 22 自由度灵巧手上平均成功率提升 54%。
物理AI的扩展规律正在变得越来越清楚:人类示范越多、覆盖的真实场景越广,机器人的动作模型就越强;更重要的是,这种提升开始变得可以测量、可以预测。

Generalist AI拿270,000小时物理交互数据训出了GEN-0。Sunday Robotics(做出ALOHA的那个团队),证明人类示范数据的采集完全可以走出实验室、在真实家庭环境里大规模跑起来。
然后就是前面说的Dyna Robotics。DYNA-2最核心的发现不只是「人类视频能训机器人」。
更重要的是,他们把跨具身迁移的拐点定位在了1万到10万小时之间。简单说就是,你给一个六轴机械臂看人类切菜的视频,训完之后,换一台人形机器人,它也能切。
这件事在1万小时以下基本不会发生。你教它在A厨房用B刀切胡萝卜,它就只会在A厨房用B刀切胡萝卜,换个桌子都不行。
但过了1万小时,曲线开始拐弯。到了10万小时这个级别,跨具身迁移的信号变得明确而稳定。也就是说,1 万到 10 万小时,是机器人「开窍」的那道坎。
尴尬的是,绝大多数团队手里的数据量还远远不够。这就导致了一个局面——Scaling Law谁都知道,但只有极少数玩家有资格验证它。
光轮智能这次开源的 10 万小时数据集,正好砸在了这个拐点上。
如何给机器人打造高质量的
「言传身教百科全书」?
10万小时的数据,可不是把摄像头开着就能攒出来的。
数据采集这行,规模、多样性和标注质量就像是个不可能三角。
量做大了,覆盖面就窄。你雇一万个人但他们全在同一间厨房里切菜,10万小时和1万小时没啥区别。
覆盖面铺开了,标注深度跟不上。场景越复杂,每帧要标的东西越多,标注成本指数级上涨。标得足够细呢?规模又上不去,因为你一天也标不了几条。
光轮智能的做法是把多样性提前设计进采集环节。不是先拍一堆然后再筛,那样来不及,而且浪费的成本根本扛不住。
他们按同一套规范作业。去什么场景、做什么任务,每一环都照着覆盖目标严格控制。
最后采集到的数据是这样的:15,000+个独立采集场景(每一个都是真实的物理空间,布局、物体、光线全不一样),15,000+项具体任务,7大类环境——家居、餐旅、零售、运动、物流、办公、工业,128种场景类型,18类任务大类。
覆盖了从厨房备菜到工业装配、从库存盘点到工具维修的真实操作。要知道,目前公开可用的第一人称数据绝大部分集中在家庭厨房和日常活动,独立场景数只有零头。EgoSuite-Open100K 直接把场景广度拉出了一个数量级的差距。
最难能可贵的是,这些都是机器人接下来真要去干活的地方,也是现有公开数据集里最大的空白。

10万小时是「量」,真正决定这套数据身价的,是「质」。全球最大的开源第一人称数据、最全的三层标注、最广的场景覆盖,三样凑齐的,目前只此一家。
EgoSuite-Open100K 每段视频带三层标注:
手部位姿教机器人手指关节怎么弯、怎么捏——21个关节点,逐帧标注;
身体位姿教它怎么伸手、怎么弯腰、怎么全身协调;
事件级语义标注告诉它这一步在干什么、动的是哪个物体。
三层叠在一起,模型才能既知道「手怎么动」,又知道「为什么这么动」。
整个数据集分成两条线。EgoStandard是主体,头戴视角,跟着人的眼睛学。
EgoPro则额外挂了腕部摄像头,贴在手腕上拍手指接触物体那一瞬间的细节。手指碰螺丝的角度、捏住袋口的力度、插入卡槽的时机,这些最精细的操作瞬间在头戴视角里恰好被手臂挡住。
腕部视角补的就是这一块,采集成本高,公开数据里几乎见不到。
真正最难啃的是标注本身。也是光轮智能这次开源数据集里最有「诚意」的地方。同类数据集到了这个量级,通常只放原始视频,因为标注成本太高了。
头戴视频一直在抖,人走路时晃、转头晃、蹲下站起来也晃。双手的关节自由度非常多,又经常被身体、物体、彼此遮挡,偏偏被挡住的又往往是操作最关键的那几帧。
抖动加遮挡,两件事叠一起,是位姿估计的噩梦,也是光轮智能在标注流水线上投入工程量最大的地方。
所以,这种带全模态信息的数据集,质量远高于只是公开第一视角的数据集。

当前具身智能行业最大的问题,不只是数据不够多,而是各家采的数据根本没法拼在一起用。
采集口径不一样,标注规范不一样,数据格式不一样,时序组织也不一样。你用A家的设备采了一万小时,我用B家的设备采了两万小时,两堆数据放在一起,模型根本吃不下去。
EgoSuite-Open100K的开放,首先要解决的就是这个问题——让所有人站在同一个数据基础上说话。这个事情由光轮智能率先开始,也再正常不过,因为光轮智能是EgoVerse全球人类数据委员会成员,正在同斯坦福、ScaleAI等头部高校和机构一起,通过开放的生态共建人类数据的标准,使人类数据变成机器人持续学习的「言传身教百科全书」。
对研究人员来说,这是第一次有一套公开、全标注、可复现的人类数据基准。过去论文里的结论,常常因为数据集太小、标注缺失而「各说各话」,如今终于有了一个全世界都能拿来对齐的坐标系。
高质量数据从示范到应用:数据价值如何验证
百科全书看完,机器人就真的学会了?
人类视频提供的是行为先验,仿真提供的是规模化试错与评价。
光轮智能全栈自研的SimFoundry仿真平台正是机器人在读完百科全书后,得以反复训练、试错并得到纠正的技术基石。
首先,从人类中提取任务、动作序列、手部位姿和事件边界,形成可复现的任务定义;随后将真实物体、材质、接触关系和任务逻辑映射到仿真环境,在不同场景、物体状态和物理扰动下反复训练;系统记录模型任务的成功率、轨迹偏差、完成时间、碰撞、失败类型;最后再用真实场景回放校准仿真结果,检查模型在仿真中的提升能否迁移到真实任务。
这样,人类数据解决的是「机器人应该向人类学习什么」,仿真解决的是「这种学习能否被大规模重复、巩固」,规模化评测则进一步回答「模型到底提升了多少」。
规模化评测就是是RoboFinals。逻辑很简单:机器人学完了得考试,不考试你不知道它到底学会了没有。

具身智能产业化要同时回答三个问题——能不能量产、能不能干活、能不能稳定。
具身智能是一个复杂系统。本体硬件、模型、环境条件、任务流程全搅在一起,任何一个变量变了,结果都可能完全不同。
所以评测的问题也变了。
不能只看「任务做没做完」,还得知道:多大成功率下能稳定完成?什么条件会导致性能退化?退化边界在哪里?失败原因是什么?版本迭代后性能有没有回归?仿真和真实现场之间偏差有多大?
RoboFinals就是来回答这些问题的。
它依托光轮智能自研的SimFoundry物理仿真平台,支持数千实例同时运行,时间不随任务量增加。
通过标准化任务定义和固定随机种子,不同团队、不同时间跑出来的结果可以直接对比。这一点至关重要,因为目前行业里的评测结果大多「各说各话」,没法横向比较。
真机评测一轮2-3周、50万+成本,还有安全风险——机器人没学好就上真机,砸了设备事小,伤了人事大。
RoboFinals把这件事搬到仿真里,一轮测试压缩到小时级,成本大幅降低——砸多少次都是虚拟的,不碰真机不碰人,多种场景、多种本体、多种模型都能规模化评测。
结语
全球首个10万小时级全模态人类行为开源数据集背后,光轮智能讲的其实是一个更完整的故事:
人类数据是教材,仿真平台是练习场,评测系统是考场,真实部署是工作,工作中考砸的地方回头补教材。这就是一个 Real2Sim2Real 持续学习闭环。
另一个值得注意的是光轮智能在国际标准上的卡位。
它不仅是EgoVerse人类数据委员会成员,和斯坦福、Scale等公司共同制定人类数据的标准;也是Newton仿真技术委员会,和英伟达、谷歌DeepMind、迪士尼研究院、丰田研究院一起制定仿真标准。另外注意:光轮智能是这两大国际具身标准委员会的唯一中国公司。
EgoSuite就是沿着这套规范建的,所以它的数据能跟其他成员的工作衔接,而不是变成又一个孤立的数据岛。
仿真标准决定「怎么学」,数据标准决定「向谁学」。同时坐在这两张桌子上的中国公司,只有这一家。

过去几年,具身智能里最贵的一批资产始终是这种没人愿意公开的人类行为数据。它决定了机器人能学到什么、学到什么程度,也决定了这个行业有多少人能真正上牌桌。
今天,10万小时的公开教材先摆出来了。
但10万小时只是起点。光轮同时宣布了一个更大的计划:5年,100亿小时,具身智能数据共建。为此,他们列了三件要干的事——统一不同设备的数据标准,让数据能跨设备、跨任务复用;从模型失败中定位数据缺口,定向补采、定向生成,用评测驱动数据闭环;数据和模型协同设计,优化仿真数据、人类数据、遥操作数据、强化学习数据的组合方式。
汇总成一句话:不仅要打造持续学习的闭环,还要招募行业伙伴共建持续学习的开放生态。

正如光轮智能创始人兼CEO谢晨博士在WRC主论坛上所言:
「人类文明来源于群体智慧,机器人的文明也不应由一家公司创造。」
从10万到100亿,五个数量级的跃升过程,将成为人类与机器人共同创造的新文明。
当ASI要从屏幕里走进物理世界,它得先看懂人是怎么端起一个杯子、怎么在遮挡里摸到一颗螺丝、怎么在做错之后自己纠回来。
这些动作,人类练了几百万年,早已刻进肌肉和本能。而机器要学会同样的事,只能靠一小时一小时地看、一帧一帧地学。
所谓100亿小时,说到底就是把人类几百万年攒下的身体经验,翻译成机器能读懂的语言。
这活儿没有捷径。
10万小时,是这本教科书的第一页。
编辑:所罗门