视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」

栏目:科技 | 来源:机器之心Pro | 2026-07-21 15:59

在多模态大模型(MLLM)时代,让模型看懂一张图早已不是难事,但要让它真正想清楚一张图,做多步的空间感知、几何分析与逻辑推断,却依然存在困难。

为了解决这种「看得到却想不对」的现象,研究界给推理链里塞进了视觉信息:一种是显式生成中间图像(如 Anole、ThinkMorph),效果理想,但算力开销高;另一种是隐式隐空间推理(如 Mirage、LVR),试图直接在特征空间里「一步」定位出目标区域,结果常常精度崩塌、注意力关注在无关的背景上。

针对这一挑战,腾讯内容服务部 BAC 提出了一个名为ProLaViT(Progressive Latent Visual Thought)的全新框架。它的核心思想是:别急着下结论,先在连续隐空间里像人一样「步步推导」。 即让模型遵循「定位 → 聚焦 → 分离」(Locate → Focus → Isolate)的因果链,逐步收紧视觉注意力,最终精准锁定目标。

该论文已被 ECCV 2026 接收。

  • 论文地址:https://arxiv.org/abs/2607.02907
  • Github 地址:https://github.com/TencentBAC/ProLaViT
  • 项目主页:https://tencentbac.github.io/ProLaViT/
  • Huggingface 地址:https://huggingface.co/collections/TencentBAC/prolavit

现有路线的问题:

显式生成太贵、隐式推理太飘

如下图所示,把视觉信息引入推理链的现有路线各有硬伤:

1. 纯文本 CoT:模态鸿沟。 让模型把推理一步步写成文字。问题在于,文本本质上是抽象的,天然丢失细粒度的空间关系。于是模型把「电视下方的家具」脑补成了「木地板」,逻辑通顺,结果却是错的。

2. 一步隐空间预测:精度崩塌。 想跳过文本,直接在隐空间里一次性指出目标区域。但单步预测往往超出了模型的表征容量,结果就是注意力跑偏,脆弱的表征最终导致错误答案。

ProLaViT 的答卷很干脆:既不画像素,也不瞎猜,而是在「结构化隐空间」里做渐进式推导。 把一道复杂的视觉题拆成一条隐式思维链,让每一步只往前走一小步。

不请「外援」:

模型自己的眼睛,就是最好的老师

训练多步隐空间模型有个绕不开的难题:中间步骤没有现成的「标准答案」图像。 以往的方法只能去请外援,例如 SAM、DINO、DepthAnything 这些外部视觉专家来当老师。然而,这样做往往带来域偏移和工程复杂度的问题。

ProLaViT 的做法是:内生自蒸馏(Endogenous Self-Distillation)。 不请外人,直接拿 MLLM 预训练视觉编码器当老师。

上述方案具体怎么做?关键在于一条可编程合成流水线(Programmatic Synthesis Pipeline)

  • 再用一次跨模态注意力,把 LLM 生成的隐式思维对齐到教师特征上,最小化蒸馏损失:

这么一来,模型在训练时就把渐进式视觉证据内化进了自己的隐空间,推理时完全不需要任何外部工具。

两套「思维套路」:

空间题靠定位,逻辑题靠思辨

ProLaViT 把推理拆成一条隐式思维链,并针对不同任务设计了两种范式。

套路一:由粗到细因果链(Coarse-to-Fine Causal Chain)。 面向视觉搜索、目标定位等空间任务,走 「定位 → 聚焦 → 分离」 的路子,注意力一步步聚焦:

套路二:辩证推理链(Dialectical Reasoning Chain)。 面向拼图复原这类逻辑任务,走 「假设 → 批判 → 验证」(Hypothesize → Critique → Verify) 的反事实思辨路线:

每一步都由 LLM 嵌入空间里的一组可学习 token 表示。

防止「思路打结」:

距离加权多样性损失

多步隐空间推理有个常见问题,即隐空间坍缩(Latent Collapse):后续步骤的表征越来越相似,隐式思维链发生退化。

作者借鉴度量学习,提出距离加权多样性损失(Distance-Weighted Diversity Loss)。先用一个带间隔的形式,允许隐式思维链的 hidden state 合理相似、只惩罚过度坍缩:

除此之外,更关键的洞见是:因果距离越远的两步,越应该彼此不同。 于是给每对步骤加上一个距离权重:

这样既尊重了推理链的层级结构,相邻步保留适度相似以延续语境,远端步被强制拉开,又有效防住了表征坍缩。

跑分见真章:

准、稳,还看得见「想法」

作者基于 Qwen2.5-VL-7B-Instruct 实现 ProLaViT,在 MMVP、VisPuzzle、VStar、ChartQA、BLINK、CV-Bench 等一系列的视觉推理基准上做了广泛测试。

1. 准。 ProLaViT(完整版,带距离加权多样性损失)拿下了75.11% 的最高平均准确率,全面超越基线。相比「一步隐空间预测」,在 VisPuzzle(+2.25%)和 BLINK-Jigsaw(+10.00%)这类复杂任务上提升尤为显著。

2. 稳。 ProLaViT 靠内生自蒸馏保持域一致性,在 ChartQA 上稳稳拿下78.99%。在最考验逻辑验证的 BLINK-Jigsaw 上,更是相比基座模型暴涨 +16.67%,验证了「假设 → 批判 → 验证」辩证范式的有效性。

3. 可解释。 作者把各推理步 token 表征的余弦相似度画成热力图:

消融实验

渐进式分解不可或缺。 把所有视觉线索压进单个隐状态的「一步预测」存在明显瓶颈;换成 ProLaViT 的多步推导后,ChartQA +15.97%、BLINK-Jigsaw +10.00%,平均 +7.45%。复杂视觉推理确实会压垮单一隐状态,而结构化链能把认知负担分摊开。

内生 vs. 外生蒸馏。 把原生视觉编码器换成外部专家:DINOv2(判别式)尚能打,但在 VStar 等细粒度感知上落后;SDXL-VAE(生成式)在 VisPuzzle 上灾难性失败。作者推测原因是 VAE 隐空间为像素重建而生,几何与空间逻辑被压成了噪声。原生编码器提供的才是天然对齐的监督信号。

推理步顺序至关重要。 把四步顺序随机打乱后,平均 下降 6.24%,VisPuzzle(-6.25%)和 CV-Bench(-8.52%)。没先建立全局上下文就直接做细粒度分割,违背了信息的自然流向,即渐进式因果结构是有效视觉推理的根本前提。

展望

ProLaViT 提出了一种「结构化隐空间渐进推导」的视觉推理新范式。它打破了「显式生成太贵、隐式推理太飘」的两难,用内生自蒸馏让模型从可编程合成数据中内化算法级精度、摆脱对外部视觉专家的依赖,再用距离加权多样性损失缓解隐空间坍缩,让每一步思维都独特而递进。

这项工作不仅在视觉搜索、拼图复原等重感知基准上取得了有竞争力的结果,更重要的是,它把推理从离散的文本空间搬进了连续的结构化隐空间,为弥合困扰传统思维链的模态鸿沟提供了一条兼顾准确率、可解释性与效率的可行路径。面向未来,把这种结构化隐式推导拓展到视频时序推理、引入更复杂的几何变换,将为更通用、更可解释的多模态智能铺平道路。

← 返回首页