
把参考图里的物体自然地「搬进」另一张照片,是电商商品合成、虚拟试穿、影视换脸与个性化创作的关键能力。真正落地却要跨过两道门槛:模型往往只擅长某一类物体,且高度依赖像素级精细掩码。
上海交通大学联合上海创智学院团队提出 A²-Edit,它以统一框架支持任意物体类别和任意精度掩码,通过混合 Transformer 专家路由、掩码退火训练及 50 万级多品类数据,让用户只需给出粗略区域,也能完成身份一致、结构完整、自然融合的参考图引导局部编辑。

- 论文标题:A²-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks
- 论文链接:https://arxiv.org/abs/2603.10685
- GitHub 仓库:https://github.com/huayu-zheng/A2Edit
参考图引导编辑的两道固有枷锁
参考图引导图像修复的目标,是把参考图中的主体语义迁移到目标图的指定区域,既保住主体身份,又与周围场景自然融合。该任务可控性强、落地价值高,却在真实使用中仍受到跨类别统一建模能力不足与精细掩码依赖严重两方面的制约。
首先,不同类别对象的编辑目标与表征需求存在显著差异:服装关注纹理一致,人像强调身份保持与形变合理,车辆、家具和建筑等刚性对象则更依赖几何结构、透视关系与材质属性的准确建模。然而现有方法通常采用单一共享参数路径处理不同类别输入,缺乏面向类别差异的动态建模与专门化机制,导致模型在跨类别场景中的性能下降。
数据侧同样存在局限性,品类分布高度同质,模型学不到通用表征。
其次,现有方法普遍要求高精度分割掩码来严格框定编辑区域,但真实场景中无论是用户手绘涂抹还是检测框自动生成,均难以获得与目标轮廓严格贴合的精细掩码。当输入掩码不够精确,模型性能通常显著下降,并容易产生边界伪影、内容泄漏、结构异常及背景破坏等问题。
专家路由 + 退火训练,架构层面双管齐下
A²-Edit 跳出「一条通路吃下所有品类」的旧范式,设计混合 Transformer 专家路由架构配合退火训练算法从架构层面解决模型跨类别统一建模能力不足的问题。

- 混合 Transformer 专家路由,实现品类差异化建模
模型将传统混合专家架构的条件路由机制由仅作用于前馈网络(FFN)扩展至注意力模块(Attention)与前馈网络的联合建模,并在各 Transformer 层中嵌入混合 Transformer 块(MoTB)。门控网络根据输入特征所包含的语义信息与类别属性,自适应计算各专家的路由权重,从而动态选择与当前编辑对象相匹配的参数分支。
路由采用锚点引导策略(AGR):主干专家作为稳定的知识锚点始终保持激活;辅助专家则根据门控网络输出进行动态选择。每层只路由一次,Attention 与 FFN 共享同一组权重。推理时仅激活主干与少量辅助专家;面对分布外输入,门控网络还能按特征相似度组合专家,提升泛化稳定性。
- 掩码退火训练策略,彻底摆脱精细掩码依赖
MATS 是在训练中逐级放宽掩码精度,引导模型从「依赖严格几何边界」转向「依靠上下文语义推理与内容生成」。
整个训练分为三个阶段:首先使用精细分割掩码学习基础编辑能力;随后通过形态学膨胀和 Perlin 噪声模拟真实用户的手绘误差;最后直接采用目标边界框进行训练,迫使模型依靠上下文推断目标的姿态、尺度和结构。
经过这样的渐进训练,模型面对粗掩码甚至检测框时依然能够生成自然、稳定的编辑结果。
- UniEdit-500K:迄今覆盖最广的多品类编辑数据集
为支撑统一框架训练、破解数据同质化,团队自建 UniEdit-500K,共包含 50 万余组参考 — 目标图像对,覆盖服装、人像、动物、植物、配饰、家具、交通工具和建筑八大类别、209 个细分类别,是目前覆盖范围最广的多品类参考图编辑数据集之一。

实验表现
研究团队在 VITON-HD、AnyInsertion 两大标准基准与自建 UniEdit 测试集上,对比 多种主流图像编辑方法,并同时评测精细掩码与粗掩码两种条件,量化指标与视觉效果均实现优势突破。
定量层面,A²-Edit 在 DINO-I、CLIP-I、LPIPS、FID 与 VLM 评分上均取得最优结果。从精细掩码切换到粗掩码时,多数基线明显退化,而 A²-Edit 的四项传统指标基本无损甚至提升,展现出突出的掩码鲁棒性。
由于 CLIP、DINO、LPIPS 等指标难以刻画边界瑕疵与局部一致性,团队额外引入基于视觉语言模型的评测协议,从边界质量、视觉真实感、局部一致性三个维度打分,A²-Edit 同样领先。24 位参与者的用户研究中,模型在与全部基线的两两比较里均获得更高偏好率。

用户研究结果:24 位参与者在与各基线的两两对比中对 A²-Edit 的偏好率
定性层面,全部使用手绘粗掩码测试。A²-Edit 则在服装、人像、宠物、建筑等多品类中稳定输出语义一致、结构完整的结果,服装保住版型与纹理,人像维持强身份一致性,建筑替换能妥善处理前后景融合。

手绘粗掩码下与多种图像编辑方法的定性对比
消融实验充分验证了各模块的必要性:移除 A²-Edit 框架,或退回仅在 FFN 加专家的常规 MoE,全品类生成质量与量化指标均明显下滑;移除 UniEdit-500K 后,细节生成与任务意图理解显著退化;MATS 若只用精细掩码训练,模型会过度贴合边界,面对粗掩码难以完成有效编辑。逐步加入增强粗掩码与边界框训练后,问题持续缓解
模型局限
从工程落地角度看,A²-Edit 仍有进一步轻量化空间:当前峰值显存约 42GB,部署门槛高于多数消费级显卡;当用户给出的掩码范围过大、同时缺少明确文本提示时,仅凭参考图和粗定位也可能出现多种合理解释。未来可继续从专家压缩、低比特部署、更强交互提示和长尾类别数据扩展等方向推进。
总结
A²-Edit 依托混合 Transformer 专家路由与掩码退火训练两项核心设计,并以 UniEdit-500K 提供多品类数据支撑,构建出一套面向任意物体类别、容忍不同掩码精度的统一参考图引导编辑方案。
它在保持主体身份与细节的同时降低了精细分割门槛,系统缓解了传统方法品类受限、掩码依赖和跨域失效等问题,为虚拟试穿、电商合成、影视制作、广告创意与个性化内容生产提供了更通用的技术路径。