多模态迎来「架构换代」:商汤连出两张牌,划定大一统基座新标准

栏目:互联网 | 来源:机器之心Pro | 2026-07-21 18:09

编辑|杜伟

刚刚结束的 2026 年世界人工智能大会(WAIC) ,具身智能与 AI 终端占据了最显眼的位置,人形机器人、灵巧手和各类智能硬件吸引了大量目光。

展台上的热闹之外,模型架构的演进构成了大会的另一条技术线。

在备受关注的多模态模型领域,行业长期陷入「搭积木」式的困境:理解、生成、编辑和行动往往分散在不同的专家模块中。这种拼接架构带来了严重的「信息衰减」—— 任务链越长,信息传递时的损耗和误差就越大,最终演变成「听懂了但画不对」、「改了局部破坏全局」的行业痛点。

这类架构问题被摆上了台面,业界急需新的解题思路。

近日,商汤科技在 WAIC 2026 发布了日日新SenseNova U1 Pro(以下简称 U1 Pro),这款面向长程任务的交付级原生多模态智能体基座模型,将理解、生成和行动纳入统一的能力框架。

而在 WAIC 召开前夕,商汤还开源了日日新SenseNova-Vision视觉大模型,将目标检测、图像分割、深度预测和三维重建等经典计算机视觉任务,直接沉淀为通用大模型的原生能力。

这连续两次出手,并非孤立的技术发布。如果说 U1 Pro 代表了商汤在「上层复杂视觉创作与交付」上的原生突破,那么 SenseNova-Vision 则回答了「底层物理世界感知与几何物理表达」如何统一进通用大模型的终极命题。两者的交汇,标志着商汤已率先卡位下一代原生统一多模态基座

「单次生成」到「长程创作」,探索视觉内容系统化交付

要实现商汤科技董事长兼 CEO 徐立提出的「Agentic Creation 智能体创作」范式,模型需要围绕复杂目标持续理解、规划、生成、检查和修正,最终交付可以直接使用的结果。

这对模型底层架构提出了更高要求。U1 Pro 的技术基石 ——NEO-unify 原生统一架构,正是商汤给出的答案。

NEO-unify 让理解、生成和编辑共享同一套表征空间:其核心设计包括支持输入与输出的近乎无损视觉接口,采用原生 Mixture-of-Transformer(MoT)架构协同视觉理解与生成,并在统一学习框架中,分别以自回归交叉熵训练文本、以像素流匹配训练视觉。

SenseNova U1 Pro 官网:https://www.sensenova.cn/u1-pro

这套架构大幅降低了跨模态交互时的信息损耗。基于此,U1 Pro 展现出面向真实产业场景的交付能力

首先是设计美感的突破。对于商业海报、品牌视觉、知识信息图这类真实创作任务,审美不只是锦上添花,它本身就是交付的一部分。U1 Pro 侧重构图、色彩、版式和视觉层级等更接近专业设计语言的维度,让模型能够理解「好看」背后的设计逻辑。

其次是8K 原生超清输出。 超长画幅和高信息密度图片放大之后很容易出现文字变形、线条断裂和模块错位等问题。U1 Pro 在大尺寸下依然能够保持文字、图标和版式关系的清晰稳定,提高了高密度视觉任务的工程可用性。

第三是图文与细节控制能力。信息图、科普图解、PPT 页面、装配说明等任务,对模型的要求远高于一般意义上的图像生成,要组织视觉元素,还要梳理信息关系、维持版式秩序,并尽可能降低文字渲染错误。U1 Pro 在这部分强化的,本质上是图像生成与信息表达之间的耦合能力。

最后是长程 Agentic 闭环思维。它支持围绕复杂目标进行数十轮 Agentic Generation Loop,在图文交错的任务过程中思考、校验和修正,并实现整体风格与局部文本的同步精准编辑。

就像在「预测美加墨世界杯」中,商汤展现出的从「一次性灵感工具」到「长程交付者」的进化:先通过 Skills 自动搜集和分析战术数据,再将晋级路径、球员对位、战术体系、传球网络和触球热力图等内容组织成可视化报告,自动组织成逻辑严密、排版精美的可视化报告,完美实现「搜集 — 推理 — 视觉交付」的全链路闭环。

U1 Pro 最核心的价值,在于它将行业对视觉模型的评价标准,从「抽卡式的单张画面惊艳度」,拉升到了「复杂长程任务的稳定完成度」

视觉创作的竞争,也由单次结果的惊艳程度,延伸到一整条任务链的稳定运行。当然,系统级交付仍需接受更多开放环境检验,比如长程任务成功率、错误恢复能力、多轮运行成本以及跨场景稳定性。

重写经典视觉底层范式,视觉任务即多模态生成

如果说 U1 Pro 关注的是如何把复杂信息图转化为直接交付成果, SenseNova-Vision 则在更底层的维度切入,解答了经典视觉任务如何融入通用多模态基座体系的问题。

过去数十载,经典计算机视觉一直依赖「专家分工」系统,检测、分割、深度估计、三维重建各套模型拥有各自的预测头(Task-Specific Heads)、损失函数、解码规则与评测协议。这套体系非常成熟,也支撑了大量产业应用,但结构性代价同样明显。数据割裂在独立管线中,能力无法跨任务复用,每增加一种新需求,系统就需要接入新的模型或专用模块。任务越多,系统越重。

SenseNova-Vision 提出了颠覆性的解法:系统性地将多类异构视觉任务,表述为原生多模态生成问题

它彻底摒弃了繁复的 Task-Specific Heads,在同一个共享的表征空间内,对文本、像素、语义信息和几何特征进行端到端统一建模:

  • 类别、坐标、OCR 结果等符号化答案,通过文本生成表达;
  • 分割掩码、深度图、表面法线等与空间对齐的密集预测,通过图像生成表达;
  • 复杂场景则直接采用图文交错混合输出

所有视觉任务的输出没有强行被压缩成单一格式,保留了文本和图像各自擅长的表达空间

SenseNova-Vision 概览。

技术报告:https://arxiv.org/pdf/2607.06560

为了支撑这一「大一统」范式,商汤对数据层面进行了系统性重组,构建并开源了 SN-VC-50M 数据集(包含 5000 万个高质量视觉监督样本),将检测框、关键点、OCR、分割掩码、深度图、表面法线、点云图和相机位姿等异构标注,统一转换为「视觉输入 + 自然语言指令 + 可解码响应」的标准范式,为整个学术界与产业界打通通用视觉基座搭建了关键基础设施。

SN-VC 的数据来源构成,以及模型训练时实际使用的数据配比。

实验数据表明,SenseNova-Vision 在实现四大类视觉任务(结构化理解、稠密几何、图像分割、多视角三维几何)全面覆盖的同时,其性能不仅在结构化视觉理解上刷新 SOTA,并在上述任务中比肩顶尖的专家模型。

对通用视觉模型而言,「任务做得多」与「专项能力足够强」具备了同时成立的可能

SenseNova-Vision 在结构化视觉理解上达到 SOTA,在稠密几何预测和分割任务上接近最强专用基线,多视角三维几何表现也逼近领先专家模型。

更重要的变化,落在能力重组上。传统专家模型的能力通常被封装在预定义任务协议中,统一训练使模型有能力处理显式训练协议之外的新任务组合,带来「跨任务能力重组」的惊喜。比如,在面对未经训练的复杂场景图(如《黑神话:悟空》《我的世界》等游戏画面)时,模型无需切换任何模块,即可在单次交互中连续输出表面法向估计、实例分割与角色关键点检测。

变化的还有视觉模型的角色。商汤为经典视觉能力进入通用基座提供了一条可扩展路径,标志着视觉 AI 正从「工具箱式的算法拼接」,迈向「全能型原生基座」的新时代。

U 系列的下一站,指向统一多模态大基座

落在多模态生成与经典视觉任务两端的 SenseNova U1 Pro 和 SenseNova-Vision,我们看似承担着不同任务,其本质上是商汤在原生统一架构上的「双向奔赴」。

据商汤透露,其未来有计划将 SenseNova-Vision 的物理世界感知与几何三维重建能力,深度融入到日日新 U 系列大模型中。届时,U 系列将演进为一个同时兼具长程创作交付、高密图文理解、物理空间感知与三维几何建模的「全感知 - 全生成」统一多模态基座

这种架构的演进,正在重新定义视觉 AI 的竞争壁垒。行业的关注点,正在从过去的「谁拥有的单点算法库更多」,转向「谁的基座模型能够吸收更丰富的专业视觉数据、以更低工程成本复用跨任务知识」。

未来尽管高精度、低延迟的专家模型,仍然将在强约束的工业场景中发挥重要作用。但毫无疑问,能够贯通理解、生成、感知与行动的原生大一统基座,正不可逆转地成为下一代通用人工智能(AGI)的核心主干。 商汤连续打出的这两张牌,无疑为这场架构换代潮划下了鲜明的标杆。

← 返回首页