超越GPT-6 Astra登顶RoboDojo,成立3个月的Simate让机器人学会「设计下一个自己」

栏目:互联网 | 来源:机器之心Pro | 2026-09-23 20:35

编辑|Youli

今年以来,RSI(Recursive Self-Improvement,递归自我改进)逐渐从硅谷前沿话题,演变为全球共识。

从 Anthropic 发布引起行业热议的《When AI Builds Itself》,到前 Thinking Machines Lab 联合创始人翁荔重回 OpenAI,牵头推进 RSI 相关技术探索,再到 Google 前首席科学家 Jeff Dean 投身相关创新…… 顶尖团队的视线几乎在同一时间锚定了同一个命题:AI 应当如何参与创造下一代 AI?

具体的数据让这场范式转换变得具象。近日 Anthropic 公布,截至今年 8 月,Anthropic 内部已有 26% 的 AI 研发工作由 Claude 主导推进,超过 90% 的研发流程已经迈入「AI 深度协作」阶段。

这似乎意味着,在数字世界中,AI 参与自身改进已经取得了阶段性成果。

但如果将这一问题从数字世界延伸到物理世界,事情显然没这么简单。

软件世界中的 AI,可以通过代码、实验环境和模拟系统快速获得反馈。而机器人面对的是一个连续、动态、且处处充满物理规律严苛制约的真实世界,一次失败的抓取、错误的动作规划、都可能意味着重新采集数据,以及动辄数天的大规模模型重训与重新部署。

因此,Physical RSI 面临的核心问题是:能否让机器人智能不再完全依附于人类工程师的疲劳战术,拥有自主发现能力瓶颈、主动生成验证假设并持续迭代自身物理智能的闭环能力?

围绕这一命题,各路玩家开始寻找破局点,

成立不久的初创团队 Simate(Silicon Mate,硅基伙伴)便是其中一家。正如其名字所寄托的愿景 ——「Silicon evolving with humanity」,Simate 希望让硅基智能成为与人类共同探索、共同演进的伙伴。

Simate 创始人张颖曾任头部自动驾驶公司的核心技术负责人,推动一段式端到端智驾方案达到国内领先水平。

自动驾驶作为目前最接近大规模真实世界部署的 Physical AI 场景之一,其积累的数据闭环、高频迭代和工程验证经验,也成为探索机器人智能进化的重要基础。

近日官方披露,成立仅三个月,Simate 的 AutoResearch 自动研究系统在机器人智能评测榜单 RoboDojo 取得第一名,并通过真机展示记忆、高精度操作、复杂长程执行与泛化能力。

这一成绩背后,是Simate 围绕 AI for Physical AI 构建的 Physical RSI 研发体系的一次工程验证。通过 AutoResearch,Simate 探索了「人机共驾弱 RSI」的实现路径:由人类研究者定义目标和约束,Agent 参与实验探索、方案优化和反馈迭代。

这似乎释放出一个信号:RSI 的探索正在从数字智能进一步延伸至物理智能,AI 不再只是帮助机器人执行任务,也开始尝试参与推动机器人能力本身的提升……

从数字智能到物理智能:

Physical RSI 为何成为下一步探索方向?

过去几年,大模型的发展让 AI 逐渐具备更强的推理和生成能力,与此同时,机器人领域也开始进入基础模型时代:VLA 架构的普及、大规模机器人数据集开源,以及世界模型的逐步演进,让机器人开始具备更加通用的感知和行动能力。

但机器人仍然面临一个核心挑战:如何持续提升自身能力。

相比数字世界,机器人无法通过简单修改代码获得反馈,它需要真实环境交互、物理数据采集、模型训练、机器人部署、失败分析、再次优化。而在传统机器人研发流程中,大量工作依然依赖人类:研究人员提出假设、设计实验方案、采集训练数据、训练模型、部署测试、分析失败。

这一流程的问题在于:机器人智能的提升速度,很大程度上受到人类研究效率限制。当每一次算法改进、数据调整和实验验证,都需要研究人员亲自推动时,物理智能的进化周期很难快速缩短。

因此,Physical AI 需要的已经不仅是一个参数量更大、架构更精巧的单点模型,而是一套能够把「做研究」这一行为本身系统化、代码化和自动化的进化框架。

这也是 Physical RSI 提出的背景:让 AI 参与物理智能研究过程,让机器人能力提升从一次次人工迭代,走向持续进化闭环。

AutoResearch 登顶 RoboDojo:

弱 RSI 阶段的工程验证

面对物理世界的复杂性,Simate 并没有直接提出完全脱离现实的全自动化研究系统,而是选择从更现实的路径开始:人机共驾的弱 RSI(Human-in-the-loop RSI)。

在这一设定中,人类研究员与自动化系统确立了全新的协作边界:

  • 人类研究员仍然掌握研究方向,负责提出研究假设、设定目标,划定边界条件与安全物理约束;
  • AutoResearch 则负责自动化研究环节,在统一体系内,Agent 自主推进具体的方案改进、生成代码修改、下发分布式实验、调用评测工具并完成多轮反馈迭代。

在这一体系中,研究不是一串预先写好的死板任务,而是一个根据实验反馈不断调整的动态过程。

研究员给出目标与约束,研究 Agent 结合已有知识提出假设、规划实验,通过模型框架修改配置并执行验证,再根据结果决定继续、调整还是终止当前方向。「提出假设 — 规划实验 — 执行验证 — 分析迭代」,构成了其核心的运转循环。

此次在机器人智能公开评测榜单 RoboDojo 上的登顶,正是这套范式的第一个工程注脚。

作为一个综合考察长程规划、空间泛化、记忆以及亚毫米级接触精度等维度的机器人智能基准榜单,AutoResearch 驱动的模型拿下第一,更是在向行业验证一个核心事实:在极度依赖物理直觉与工程经验的机器人智能研发中,「做研究」的能力本身同样可以被标准化与自动化运转。

网址链接:
https://robodojo-benchmark.com/leaderboard#news

Physical RSI 背后的自主研究基础设施:

让「做研究」成为可持续运行的系统

自动科研系统要避免沦为纸上谈兵的代码生成玩具,必须具备扎实的物理数据输入、模块化的算法底座,以及强大的工程基础设施支撑。

围绕这一目标,Simate 正在构建一套自主研究基础设施,将模型、数据、实验和反馈连接起来,让研究者与 Agent 能够在同一套系统中:提出问题、执行实验、分析结果、将获得的经验带入下一轮研究。

Physical RSI 需要 AI-native 的模型框架、研究员友好的研究记忆与协作系统,以及 AI-native 的数据和基础设施共同支撑。其背后的工程设计,让模型修改、云端实验、结果反馈与人的判断持续衔接,再将有效方法与经验用于下一轮研究。

从研究目标、模型修改、云端实验到评测反馈与人工决策的关系

1. 首先是「人机共驾的弱 RSI」的研究范式

作为整套系统的顶层牵引,弱 RSI 范式界定了人机协同的协作方式。低风险、易验证的实验由 Agent 持续推进;遇到高风险或需要资深专业判断的节点,系统则主动将方案交回研究者裁决。人类研究员可以随时介入并调整约束,真正做到了「系统持续推进,研究者始终掌握方向」。

这种模式的核心变化在于让研究者从大量重复性的实验执行中解放出来,将更多精力投入到问题定义和方向判断,而 AI 则成为研究能力的延伸。

2. 可插拔模型底座 SiPAI:让研究想法真正落实为模型变化

要让 Agent 真正参与模型研究,模型本身必须能够被系统理解、修改和验证。Simate 构建了模块化模型开发基础 ——SiPAI。

SiPAI 采用高度解耦的可插拔设计,统一支持了包括世界模型(WM)、世界动作模型(WAM)、视觉语言动作模型(VLA)与视觉语言模型(VLM)在内的多种主流前沿架构。对于已经接入的模型组件,研究者可以通过配置文件选择、组合和调整,并沿用统一训练与评测流程。

基于 SiPAI 与 AutoResearch,系统已经开始探索多个机器人智能研究中的关键问题:

  • 训练与推理效率优化:系统围绕计算合并、训练推理加速以及分布式加载展开优化,改进成果反哺框架本身,让后续实验运行得更快;
  • 历史信息的记忆平衡:面对长程任务,模型并非保留越多上下文越好,系统通过实验寻找关键记忆选择与运行开销之间的最佳平衡点;
  • 训练 Recipe 与精准配比:围绕关键动作、容易失败的动作以及不同难度的样本进行动态配比实验,直接回答「接下来该用什么数据、怎样训练」;
  • 动作执行与闭环部署策略:预测出的连续动作并不一定要全部执行,实际执行多长的 Action Chunk 会直接影响物理反馈频率;系统围绕执行长度、动态调整策略与动作补偿共同实验,让预测与部署在同一流程中协同改进。



3. 大规模真实物理数据体系:让机器人从真实世界获得持续经验

机器人智能提升依赖真实世界经验,在借鉴 Generalist 以规模化真实物理交互驱动预训练的技术思路,Simate 使用基于同构 UMI 的数据采集体系,以统一的观测与动作接口承载多样化的任务、物体和场景。

在数据治理上,团队并未单纯追求小时数,而是贯彻时序对齐、轨迹质量、任务覆盖与训练配比四个维度,推动高质量数据、模型容量和训练计算的协同扩展,进而激发新任务适应、技能组合以及意外恢复等高阶涌现能力。

基于此,团队探索可迁移的感知与动作表征,以及更稳定地激发新任务适应、技能组合以及意外恢复等高阶涌现能力。

4. 闭环机制:研究与数据在同一体系内互相反馈

对于 Physical AI 而言,真实部署并不是研发结束,而是下一轮研究开始。机器人在真实环境中遇到的各种问题本身就是重要反馈。

为此,Simate 建立了一套多层级的评估与反馈飞轮:

  • Agent 通过模型与数据配比实验自主验证假设;
  • 世界模型评测与仿真闭环提供高频即时信号,帮助系统快速定位能力断点;
  • 最终的模型被下发至真实物理机器人上执行任务,在真实物理世界中遭遇的接触打滑、轨迹卡顿或任务失败案例,会被系统结构化沉淀,重新作为下一轮 Agent 提出研究假设与调整数据配比的依据。最终,物理世界暴露的问题,在此转化为了算力与算法自我改进的「燃料」。

在这一过程中,物理世界不再只是模型部署场景,它同时成为推动模型进化的重要来源。

5. 为自动试错定制的 AI-native Infra

当多位研究员与数十个 Agent 在同一个集群内并行发起实验,传统基于调度脚本的深度学习基础设施显然已不足以支撑,需要面向 Agent 研究的新型基础设施。

为此,Simate 构建的 AI-native Infra 提供了包括多 Agent 编排、多卡算力统一调度、实验环境管理、故障恢复,以及统一实验资产记录的能力。

这保证了即便在极高并发的自动化试错中,集群也不会因个别崩溃而中断,所有失败与成功的先验经验都能在不同的 Agent 与模型版本间沉淀复用。

此外,系统还提供研究过程的可观察能力。例如研究谱系可以记录不同研究方向、方案分支和评估状态;运行时间线可以展示训练、评测、诊断任务之间的关系等,从而让研究者能够理解哪些方向被延续、哪些方案被淘汰、为什么系统进入下一步探索……

据公司介绍,研究者目前可以通过 SiMate 官网了解相关系统并申请试用。系统图解释各环节如何连接,真实案例说明改进如何产生,开放入口则让外部研究者进一步了解工具的实际使用方式。

官网链接:https://simate.ai

以 4D 物理感知与记忆,打造通用物理快系统

AutoResearch 服务于 Simate 的一个明确目标:以 4D 物理感知与记忆机制为核心,构建大规模、可端侧实时部署的物理原生快系统,提升对复杂任务的连续执行能力,并通过与慢系统协同,向少样本乃至零样本的通用操作推进。

这一目标也与 Generalist 等前沿公司对通用机器人模型和新任务适应的探索形成呼应,具体模型规模将在后续技术报告中披露。Simate 希望通过视觉编码、时空建模和特征压缩等设计,让更大的模型容量与实时物理交互相互兼容。

4D 物理感知关注空间结构及其随时间发生的变化,让深度、几何、运动与接触信息直接服务于动作理解和生成。记忆机制则围绕任务进展、连续状态与即时反馈组织历史信息,使模型能够利用过去的观察持续行动,并兼顾长程任务与实时响应。

此次真机展示进一步呈现了基于演示的任务适应、记忆、复杂长程执行和精细操作等能力。从理解示范中的任务线索,到保留必要信息、衔接多个动作,Simate 希望让模型已经获得的能力在更多新任务和新场景中复用,减少专门采集、训练与工程调试的投入。

最终要检验的是:当任务、物体或环境发生变化,机器人能否以更少的适配,保持可靠的任务完成能力。这也决定了模型进步能否转化为实际商用价值。

视频链接:https://mp.weixin.qq.com/s/fMbm9PqjABhFGOJfeCO5eQ

从「人机共驾」通向「完全自治」:Physical RSI 的三阶段路线图

AutoResearch 拿下 RoboDojo 榜单第一名的成绩固然证明了 Simate 当前这套「弱 RSI」研究范式的工程可行性,但对于 Simate 而言,这只是起点,团队为 Physical RSI 划定了清晰的三阶段演进路径。

第一阶段,弱 RSI(人机共驾,Human-in-the-loop):人类研究员提出假设、设定目标与约束,Agent 自主推进方案改进、实验执行、评测与反馈迭代。

这一阶段的核心,是证明 AI 能够进入机器人研究流程。

目前,这一点,Simate 已通过 AutoResearch 登顶 RoboDojo 得到了坚实的工程验证。

第二阶段,强 RSI(进一步减少人工参与):Agent 开始承担更多研究工作,包括尝试自主提出研究假设、规划实验路径,并评估研究方向,而人类转向目标治理与关键决策监督。

目前,这一点是 Simate 的攻坚方向,正持续探索中。

第三阶段:完全自治 RSI(Fully Autonomous,无人类参与的递归自我改进):研究、数据、模型与真实部署的完整闭环由系统自主运转,物理智能在持续运行中自我进化。

其实,可以看出,随着系统自治权重的逐步递增,研发人员的角色也将迎来深刻蜕变:从繁重的实验配置与调参中解放出来,成为定义系统价值与安全边界的顶层架构师。当然,这仍然是一条长期探索路线,而这也正是 Simate 的长期目标。

从顶尖智驾快系统,到世界模型与机器人研究力量的汇合

同样来自智驾,团队的技术积累可以很不一样。从有图、无图到一段式端到端,代表不同技术范式,Simate 核心团队站在第三代技术路线上,并在这一方向交出了国内顶级成果,也是国内极少数和 tesla fsd 可比较的智驾系统。一段式端到端将大模型的数据、训练与迭代能力,同真实物理世界中的感知、决策和连续行动结合,也让团队积累了从模型突破到实际部署的完整经验。

与此同时,香港科技大学助理教授、World Mind Lab 负责人占方能,以及具有北美机器人研究与创业经历的季马泽宇等人才加入,带来世界模型、三维视觉、灵巧操作与人形控制方面的研究积累。

顶尖智驾工程能力与年轻研究者的创造力汇合,使团队能够从零到一推进模型与系统,并将长期积累转化为进入新领域后的研发速度。

一项技术范式若想真正形成行业影响力,除了技术突破,也需要从少数团队的内部能力,走向更多研究者可以使用的基础设施。

长期以来,机器人智能研究往往面临较高门槛:昂贵的机器人硬件、复杂的真机维护、高额的算力需求、长期的数据积累,等等,这些因素限制了大量研究团队参与。

换句话说,Physical RSI 想要进一步发展,也需要降低研究门槛。

基于此,Simate 已将其自动化研究系统向清华、北大、MIT、加州理工、哈佛、哥大等海内外高校师生开放内测,并已有研究者使用。后续,Simate 也计划逐步向业界开放覆盖数据、训练与评测全流程的基础设施工具,让支撑其研发的顶级工程能力服务于更广泛的研究与应用。模型与自动化研究相关技术报告,以及围绕物理原生表征与泛化、记忆与长程操作、自动化研究与效率的三篇研究文章,也将陆续发布。

Simate 认为,如果 AutoResearch 所代表的科研自动化能力能够通过平台化的方式普惠至高校实验室与独立开发者,整个机器人智能赛道的创新周期或将被极大压缩。未来,随着自动化科研基础设施进一步开放,更多研究者可能参与机器人智能探索。

拿下 RoboDojo 榜单第一名,固然为 Simate 赢得了一个漂亮的登场切片,但更具行业启示意义的,是它展现出的那种可能性:当冰冷的机械手臂与算力集群不仅能执行任务,还能在物理世界真实的碰壁与磨损中学会自主研究,物理智能的进化速度,或许正在挣脱人类肉身所设定的时钟限制……

最后,目前「AutoResearch 科研平台内测」正在火热招募中,欢迎感兴趣的朋友们踊跃报名参与!

了解更多

猜你想看

← 返回首页