

大模型进入物理世界的门槛正在改变。
作者|田思奇
编辑|栗子
当大模型从数字世界走向物理世界,真正的挑战已经从“能不能看懂”转向“能不能理解现实,并据此完成下一步行动”。
机器人面对的不是标准化的图片,而是不断变化的真实空间:物体会被遮挡,视角会发生变化,不同物体之间存在距离、方位和接触关系,一项任务还往往伴随着严格的执行约束。这意味着,过去以图文理解为核心建立起来的多模态能力,需要进一步向空间理解、状态判断和任务规划延伸。
9月15日,紫东太初正式开源 ZDTaichu5.0-9B。
这款 9B 参数通用多模态大模型,在九项国际空间理解基准测试中取得 8 项同参数通用组第一。它不仅通用能力维持在第一梯队,更是 10B 参数规模里空间具身能力领先的通用多模态大模型。并首次将完整的空间多模态数据生产管线详细方案开放给产业界。

如果只把它看作一款“更强的9B模型”,可能低估了这次开源的产业意义。
更值得关注的是:经过多年多模态大模型技术积累后,紫东太初正在把模型能力从数字世界进一步延伸到物理世界,并尝试以一个通用、开放、可二次开发的模型底座,回应空间具身智能走向产业化过程中面临的几个关键问题。
1.从“看懂图片”到“理解空间”,大模型进入物理世界的门槛正在改变
过去几年,大模型的能力边界快速从文本走向图像、视频、语音和代码。文档解析、图文问答、视觉数学、代码生成等数字信息处理能力已经形成成熟的产业应用体系。但当模型真正进入机器人、智能制造和科研自动化场景,问题开始发生变化。
一台机器人看到一个工作台,并不只是需要知道“这里有一个杯子”。它需要进一步知道:杯子在哪里,与机械臂是什么关系;从另一个视角观察后,杯子是否仍然是同一个对象;前方是否存在遮挡;目标区域是否具备放置条件;当前状态是否允许执行下一步动作。
这背后对应的,是从视觉识别走向空间理解,再从空间理解走向任务规划。因此,空间具身智能真正需要的,并不是一个单纯“会看图”的视觉语言模型,而是能够建立物理世界空间表征、持续理解环境状态,并将这种理解转化为任务决策的通用模型。这也成为当前多模态大模型继续向物理世界延伸时绕不开的一道门槛。
从产业实践来看,围绕这一方向已经形成两类明显路线:一类模型强化通用视觉语言能力,综合能力较强,但在复杂空间推理上存在不足;另一类模型针对空间、具身等专项能力进行强化,却可能面临通用能力和跨场景复用能力的取舍。
如何在一个有限参数规模内,同时保住通用多模态能力,又把空间具身能力做深,成为一个更具产业价值的问题。
ZDTaichu5.0-9B选择的,正是这条路线。
命题一:空间具身能力与通用能力,不必二选一
ZDTaichu5.0-9B最直接的技术信号,是它没有将自己做成一个垂直的空间专项模型。在九项国际空间理解基准中,Taichu5.0-9B取得8项同参数通用组别第一;在代表复杂空间推理能力的 MindCube-tiny 上取得78.27分,相较 Qwen3.5-9B 高出20.67个百分点;在 ViewSpatial 等跨视角空间理解任务中,同样展现出较强表现。

这些指标背后的意义,不只是榜单排名。
真实机器人环境中,摄像头发生移动、目标发生遮挡、观察视角发生变化是常态。模型需要处理的不是一张图片中的静态关系,而是不同观察视角下物体与环境之间关系是否仍然成立。
在实际测试中,针对视频序列目标检索、机位变化后的方位判断、可交互区域筛选等任务,ZDTaichu5.0-9B能够持续输出空间坐标和方位判断,为后续任务规划提供基础。
与此同时,它并没有以牺牲通用能力换取空间具身能力。OCR、图文理解、视觉数学、图表理解,以及指令遵从、代码 Agent、数学推理等能力仍保持较强表现。依托对任意分辨率输入支持,也能够处理复杂场景中的细粒度目标识别。

这意味着它的定位并不是“空间具身能力更强的专项模型”,而是:
在通用多模态底座之上,把空间具身智能能力进一步向物理世界延伸。这种路线对于产业落地尤其重要。
机器人厂商、制造企业和科研机构真正需要的,往往不是只能完成某一个任务的模型,而是能够进入不同业务环境、持续进行二次开发的通用能力底座。
ZDTaichu5.0-9B采用的自适应循环推理机制,也服务于这一目标。
对于相对确定的识别任务,模型可以直接完成推理;面对空间旋转、物体关系判断、约束校验等复杂任务,则通过内部循环进一步优化特征表征,使计算资源更多用于高难度任务。

本质上,这是在有限参数规模下寻找“通用性、空间具身能力与推理效率”之间的新平衡。
9B参数的意义也正在这里体现:它不是单纯追求模型规模,而是在能力密度与产业部署成本之间寻找更现实的结合点。
命题二:开源不能止于权重,产业真正缺的是二次创新能力
如果说模型能力解决的是“能不能用”,那么开源之后能否被产业真正拿来改、拿来训,则决定了它能不能成为产业底座。这也是当前开源生态中一个容易被忽视的问题。
对于机器人厂商、制造企业和科研机构而言,拿到模型权重只是第一步。
企业真正拥有的是自己的场景数据:产线上的真实画面、实验室操作过程、机器人轨迹、设备状态以及大量业务流程数据。但这些数据并不能直接拿去训练模型。
从原始数据清洗,到空间关系标注,再到训练样本构建、监督微调、强化学习,每一个环节都需要专业的数据工程能力。对于大多数产业机构而言,真正高昂的并不是一次模型调用成本,而是从零搭建一套模型二次训练体系的成本。
ZDTaichu5.0-9B此次开源的一个重要区别,在于它没有只开放模型权重。
紫东太初同步开放了完整的空间多模态数据生产管线详细方案。

从原始数据收集、哈希-URL双重去重、画质过滤,到三维能力标签体系、思维链样本构建,再到预训练、SFT、高质量退火以及GRPO可验证强化学习,形成完整的数据与训练流程。
对于产业方而言,这意味着拿到的不只是一个已经训练好的模型,还包括一套可以继续使用、修改和迭代的工程体系。尤其是在具身智能领域,模型面对的是高度行业化的数据。
汽车工厂里的工件、实验室里的试管、仓储环境里的货架,都有不同的空间关系和任务约束。真正决定模型能否进入具体产业场景的,是企业能否将自己的场景数据持续转化为模型能力。
因此,开放权重解决的是“模型可获得”,开放数据生产方案和训练体系解决的是“能力可生长”。
这也是ZDTaichu5.0-9B此次开源更值得产业关注的地方。
命题三:从仿真走向真实世界,空间具身理解最终要接受实体任务检验
但模型真正进入物理世界,还有一道更难跨越的门槛:仿真与现实之间的差距。在标准化数据集和仿真环境中,任务边界往往是明确的。真实环境却完全不同。一个物体可能被遮挡,一个目标可能改变位置,一个操作可能因为前置条件没有满足而无法执行。对于连续数十步的任务而言,早期一个很小的判断偏差,都可能在后续动作中不断累积。

因此,真正的具身智能不能只是回答“下一步应该做什么”,而需要持续回答三个问题:
环境现在是什么状态?
任务已经进行到哪一步?
基于当前状态,下一步什么动作才具备执行条件?
ZDTaichu5.0-9B目前将自身定位为高层认知与任务规划单元,底层运动控制和设备安全逻辑仍由机器人控制系统承担。
在科研 Agent 场景中,模型已经进入实体实验流程:既可以调用计算工具完成科学问题求解,也可以进一步参与试管入架、液体转移等实体实验操作。在任务过程中,即便抓取动作改变了物体的位置和画面坐标,模型仍需要持续维护样品身份和任务状态。
在智能制造场景中,模型则面向备料配送、机台上料等任务,处理零件相似、物体遮挡、货架密集以及操作前置条件等真实现场问题。
这意味着,模型能力验证正在从“Benchmark分数”进一步走向“任务闭环”。
当然,从仿真环境到大规模真实世界部署,仍然存在大量工程与技术问题,尤其是复杂长时序任务的稳定性、泛化能力、安全控制和成本等,仍是整个行业需要持续解决的问题。
但产业方向已经变得清晰:
具身大模型的价值,不再只是让机器“看见”,而是让模型能够持续理解真实环境,并为行动提供可靠的认知基础。
2.从多模态到空间具身智能,紫东太初正在进入物理AI的新阶段
ZDTaichu5.0-9B并不是紫东太初第一次押注多模态。
从早期原生多模态技术积累,到中文千亿参数级多模态大模型,再到今天进一步向空间具身智能的延伸,紫东太初走的是一条持续强化“模型理解现实世界能力”的技术路线。
这也是理解ZDTaichu5.0-9B价值的关键。
如果把这次开源仅仅理解为“又一个9B模型”,它的意义很容易被参数规模和Benchmark数字遮蔽。但如果放到产业演进中看,它实际上对应了一个更大的变化:
大模型的竞争边界,正在从数字信息处理能力,向理解和进入物理世界的能力延伸。在这一过程中,产业真正需要的也不只是一个更大的模型,而是一套能够被开发、被训练、被部署、被持续迭代的基础能力。
ZDTaichu5.0-9B给出的路径,可以概括为三层:
模型层,在通用多模态能力基础上强化空间理解和具身能力;
数据层,开放空间多模态数据生产方案与训练体系,让产业方能够基于自身数据进行二次创新;
场景层,从仿真评测进一步走向科研自动化、智能制造等实体任务验证。
这三层共同构成的,才是一个面向产业的空间具身智能底座。
物理AI仍处于早期阶段,真实世界中的复杂性远高于任何标准化评测,距离大规模商业化也还有很长的路要走。
但可以确定的是,当机器人、高端制造和科研自动化逐渐成为AI新的应用载体,空间具身智能正在从一个模型能力分支,逐渐成为连接大模型与物理世界的重要基础能力。
而紫东太初此次开源ZDTaichu5.0-9B,则是在这一拐点上,将多年多模态大模型技术积累进一步推向空间具身智能,并试图把这种能力沉淀为一个开放的国产空间具身智能模型底座。
(封面来源:AI,文中配图来源:紫东太初)
