PhyAgentOS v1.0.0发布:为物理智能体打造可执行、可验证、可演进的Harness

栏目:互联网 | 来源:机器之心Pro | 2026-09-11 13:51

最近,一条很科幻的视频在网络上被不断转发:

画面从一条自然语言指令开始:利用现场材料,配制并核验六级 pH 彩虹。没有人为逐步遥控,系统先识别实验台上的物料,再让四足机器人、人形机器人和双臂机器人依次完成扫描、运输、交接与台面操作。三台构型不同的机器人,共用同一个任务上下文。

真正体现系统作用的,是任务中途出现偏差之后。第六支试管的颜色没有达到目标,系统没有把 “动作执行完” 当成任务完成,也没有从头再来,而是保留现场状态,补充缓冲液并重新检测。pH 实测为 11.03、进入目标容差后,任务才通过验证。

支撑这条 “决策 — 执行 — 留证 — 验证 — 修正” 链路的,是 PhyAgentOS v1.0.0:一套由中山大学 HCP 实验室、鹏城国家实验室具身智能研究所与 X-Era Lab(拓元智慧)联合研发的开源物理智能体 Harness。它兼容 VLA、世界模型、仿真与真机,并面向异构机器人提供统一执行基座,也为 RSI(Recursive Self-Improvement,递归自我改进)提供可追踪的工程基础。项目于 2026 年 7 月开源,8 月底发布首个稳定版;截至目前,GitHub Star 已突破 2100。

  • GitHub:https://github.com/PhyAgentOS/PhyAgentOS-core
  • 项目网站:https://phy-agent-os.x-era.com/
  • 技术报告:https://arxiv.org/pdf/2607.16636

01 三台机器人接力,失败之后没有从头再来

视频链接:https://mp.weixin.qq.com/s/c8RWwl_nSpzlunxe9HgOvQ

PhyAgentOS REPLAN³ 实拍演示

这段四分钟左右的演示里,用户只给出最终目标,没有为每台机器人分别编写动作脚本。系统完成环境感知和物料定位后,把扫描、运输、交接和配液等步骤分配给四足机器人、人形机器人与双臂机器人。三者依次接力,上层 Agent 看到的是一个连续任务,而不是三套彼此割裂的设备流程。



前五支试管顺利完成后,第六支试管的颜色与目标不符。这里如果只看控制信号,机器人已经做完动作;但 Verifier 综合现场图像与检测结果,判断任务仍未完成。系统在同一个 AgentTask 中追加 PlanRevision,保留此前动作和当前环境状态,重新补充缓冲液和试剂并再次核验。直到 pH 实测为 11.03、进入目标容差,任务才被标记为通过。

这也把 PhyAgentOS 要解决的问题具体化了:物理智能体不能只会把动作发出去,还要知道每一步有没有证据、最终结果是否达标,以及失败后应该从哪里接着做。任务分解、异构调度、证据采集、结果验证、有限恢复和经验沉淀,构成了这套 Harness 的完整链路。

图 1|PhyAgentOS v1.0.0 总体架构:Forge 统一物理执行,验证与经验回流构成两条可信闭环。

02 结果验证与受控恢复:从 “动作结束” 到 “任务完成”

传统控制链路往往把设备返回的完成信号视为任务结束,但 “夹爪已闭合” 并不能证明目标物抓取成功,“指令已接收” 也不能证明用户目标已经达成。PhyAgentOS 将执行事实、现场证据与任务结论拆开:Query、Action 和 Session 记录工具调用及执行状态,Evidence 模块保存动作前后的图像、检测结果与设备状态,任务级 Verifier 再依据目标、成功标准和证据时序,给出 success、failure 或 replan required 的结论。

图 2|任务契约、执行事实与现场证据共同进入 Verifier,输出可检查的任务级结论。

当验证未通过时,恢复过程仍属于原 AgentTask。系统基于既有工具轨迹、证据链与最新环境状态追加 PlanRevision,而不是重新创建任务或盲目重试。这样既保留了状态连续性,也能限制恢复范围和重试次数;视频中仅重做第六支试管,正是一次有界恢复。

基准测试进一步量化了这套机制。在 LIBERO 的 2000 个 Episode 中,X-VLA 首次成功率为 97.3%;PhyAgentOS 对 54 个首次失败样本进行分析与恢复,挽回 26 个,最终成功率提升至 98.6%。系统未修改策略模型代码,也没有把恢复过程记作新的 Episode。在 CALVIN 五步长程任务上,完整链路最高提升 4.1 个百分点;在 RoboCasa365 上,RLDX-1 与 WorldDreamer 分别提升 7.2 和 8.4 个百分点。

图 3|First attempt 与 Final outcome 分开统计,用于区分策略原始能力和系统恢复收益。

03 经验回流:用验证结果驱动 Skill 持续演进

结果验证不仅决定任务是否结束,更是经验进入系统的第一道门槛。PhyAgentOS 以通过验证的完整任务为基本样本,将目标、计划修订、工具轨迹、证据指纹与最终结论整理为 TaskEpisode,再进入经验提炼流程。没有证据支撑或尚未闭环的执行记录,不会直接转化为新能力。

经验提炼后形成两类候选结果:稳定、可复现的工作流可晋升为 SkillCandidate,反复出现且能够归因到工作流的问题可聚合为 Lesson。设备掉线、网络抖动、传感器噪声或证据不足等环境异常只保留诊断信息,不进入经验库。Skill Runtime 则负责检查技能制品、依赖环境、健康状态与生命周期,确保 “知道怎么做” 和 “当前能不能做” 保持分离。

候选经验正式生效前还要经过多任务佐证、结构校验与安全检查。系统会过滤具体坐标、凭据、临时设备 ID,以及任何试图绕过 Forge 或 Verifier 的指令,避免一次偶然成功污染已有能力。由此,Evolution 模块沉淀的不是原始日志,而是来源可追踪、条件可检查、能够在后续任务中复用的经验。

图 4|Verified AgentTask 经 TaskEpisode、反思归因与多次独立支持后,才进入 Skill 或 Lesson。

04 Forge 执行框架:统一异构机器人的物理动作入口



Forge 是一个面向 Physical AI 的通用机器人控制底座,用统一的机器人、传感器、环境抽象,把硬件和算法策略组织成可组合、可复用、可被结构化调用的能力。

现实场景里的机器人很少来自同一家厂商。仓库中,四足机器人可能负责穿过狭窄通道巡检;机械臂负责在固定工位抓取和放置;人形机器人则更适合操作原本为人设计的按钮、柜门或工具。它们使用不同控制接口、传感器和软件环境,过去若要协同,往往需要为每一种机器人单独开发和调试。

PhyAgentOS 的一个核心亮点,是以统一协议把异构机器人接入同一套任务系统。上层 Agent 不需要逐一理解不同机器人的控制细节,只需调用标准化的 Tool;底层 Forge 则负责识别设备能力、路由任务、下发指令并管理执行状态。

例如,门店系统给出 “完成 A 区货架巡检与缺货复核” 的任务后,四足或轮式机器人可以负责移动和采集图像,视觉能力负责识别货架状态,机械臂在具备条件的场景中再完成取放或补货。系统关注的是任务有没有完成,而不是操作者必须手动切换三套设备控制台。

统一协议的价值,不在于让所有机器人变得一样,而在于让它们能够在一个可追踪的任务链路里各自发挥所长。新机器人接入时,只要按统一方式声明自身能力,就可以被上层任务调用;更换机器人本体、模型或仿真器时,也不必同步重写整条任务逻辑。

在这里,PhyAgentOS 将模型决策与动作执行解耦:上层 Agent 负责任务理解、规划与策略调整,Forge 作为唯一的物理动作执行入口,负责能力发现、路由和执行状态管理。Gateway 统一注册并管理技能,ToolEndpoint 将工具调用映射到具体机器人动作,Dora 数据流承载实时数据与控制链路。Query 用于同步读取状态,Action 和 Session 才能触发真实物理执行,从协议层区分 “观察世界” 和 “改变世界”。

v1.0.0 也重新划分了系统状态协议。AGENTS.md、SKILL.md 等 Markdown 文件继续承载面向人和 Agent 的可读知识;真实动作统一通过 Forge Tool API 执行;AgentTask、PlanRevision、Evidence 和验证结果则写入结构化事实记录。知识、执行与事实各自落在合适的载体中,系统不再依靠轮询文件驱动物理动作。即使遇到超时、取消或结果未知,也会先核对现场状态,再决定后续动作,降低重复执行风险。

图 5|协议升级后,知识、执行与事实分层存放,Markdown 不再同时承担调度、状态与日志职责。

05 用 Tool 与 Skill 组合原子能力,解决复杂长程任务

真实世界的工作通常不是一个动作。巡检货架需要移动、识别、拍照、判断、复核;补货需要确认商品、取货、避障、放置、检查排面;生产线上一次换型,则可能涉及搬运物料、打开工装、上料、检测和异常处理。

PhyAgentOS 将这些动作拆解为可调用、可验证的 Tool。例如,“读取状态”“移动至货架”“拍摄图像”“抓取物料”“放置商品”“复核结果” 都可以是一个 Tool。经过多次验证、能够重复使用的流程,则进一步沉淀为 Skill。

这种 Tool 与 Skill 的自由组合,让系统不必为每个复杂任务都重新编写一条僵硬的脚本。面对 “完成 B 区货架巡检并处理缺货商品” 这样的任务,它可以根据现场情况组合移动、扫描、识别、抓取和复核能力;如果某一步出现遮挡、商品错位或抓取失败,也能针对问题环节调整,而不必让整个流程从头开始。

这也是复杂长程任务能走向实用的前提。机器人不需要一次性记住所有流程,而是能够在任务目标约束下,调用已经验证过的能力模块,并根据现场反馈持续推进。

06 生态与接入:让模型、技能和机器人保持可组合

统一的 Tool 契约降低了跨构型适配成本。据项目团队介绍,接入一种新的机器人构型通常只需 5 到 10 分钟;更换模型、仿真器或机器人本体时,上层 Agent 与任务链路无需同步改写。官方支持的机器人构型已从 19 种扩展到 43 种,覆盖机械臂、四足、人形机器人、移动操作平台和灵巧手,其中 9 种支持真机运行。正式版提供 9 个算法节点,涵盖 VLA、世界模型、视觉感知和模仿学习,另有 11 个节点列入开发计划。

PhyAgentOS 采用 MIT 协议开源,核心仓库已迁移至 PhyAgentOS 组织并更名为 PhyAgentOS-core。完成模型 Provider 配置后,即使没有真实硬件,也可以先运行通用 Agent;若要驱动真机,还需安装对应的 Forge Skill、Runtime 与硬件依赖。最简安装和启动命令如下:

PhyAgentOS v1.0.0 的核心变化,不是再增加一层模型封装,而是为物理智能体补齐可执行、可验证、可恢复、可演进的 Harness。Agent、Forge、Evidence、Verifier 与 Evolution 分别负责规划、执行、留证、验收和经验沉淀。这套职责边界,决定一次 Demo 能否转化为长期、稳定的系统能力。

产业化不会因为一套开源系统发布就突然完成。机器人本体的可靠性、现场安全、部署成本、数据质量、网络条件,以及与既有业务系统的衔接,仍然决定着具身智能能否真正进入生产流程。

但行业方向已经越来越明确:竞争正从 “机器人能否完成一次炫目的演示”,转向 “能否在真实任务中稳定完成、验证结果、处理例外,并持续降低人工干预”。

在零售门店,闭店后的货架巡检就是一个典型场景。机器人沿着通道移动,读取货架状态,发现某个位置缺货或商品错位后,再调用对应设备完成复核或补货。它不需要一开始承担整家门店所有工作,但可以先在一个区域、一类商品、一个明确的时间窗口内完成稳定闭环。

在工厂里,生产线换型同样适合这样的协作方式。移动机器人把物料送到工位,机械臂接续完成上料或装配,视觉系统负责检查结果。一旦发现某个零件方向不对、位置偏移或装配不完整,系统保留现场状态,只返工出错环节,而不是让整条产线停下来重新开始。

事实上,作为 PhyAgentOS 的主要研发团队,X-Era Lab(拓元智慧) 正在将这套体系进一步带入智慧零售、工业制造与人居服务等真实产业场景,让 Physical Agent 在持续运行中完成验证、经验回流与能力迭代,逐步从单点 Demo 演进为可长期部署、持续进化并规模化复制的系统能力。PhyAgentOS适合科研人员、机器人本体厂商与终端用户三类人群:为科研提供真实、可量化的具身智能研究底座;为厂商提供全域适配、快速部署能力;帮助终端机器人在复杂动态场景中持续学习、稳定高效作业。

了解更多

猜你想看

← 返回首页