一张电商图片,既要准确展示商品,也要契合用户喜好,更承载着价值转化的商业期待。当图像编辑开始读懂用户偏好,模型能否将不同的创作意图转化为合心意、可使用的电商素材,进一步激发商业价值潜能?
快手技术团队推出 KwaiMind,一套面向真实电商内容生产的图像编辑基座模型。融合通用图像编辑与电商专项能力,在保留商品细节、准确呈现文字的同时,满足多样化创作需求,并配套构建电商任务评测体系,形成从数据生产、模型训练到效果评估与业务反馈的完整闭环。
据技术报告披露,KwaiMind 在多项通用图像编辑基准上取得参评开源模型综合得分第一;在自建电商评测 Ecom-Bench 中,视觉总分位居参评开源模型第一。线上商品主图素材优选 A/B 实验中,KwaiMind 带来实际点击率相对提升约 2.44%,展现了电商图像编辑的商业应用潜力。

图 1 Ecom-Bench 视觉总分与 Ecom-CTR 排名比较。CTR 为预测排名累计计数。
从通用编辑到定向修复,覆盖真实素材生产需求
KwaiMind 将增删、替换、构图调整和局部问题修复纳入同一套指令式编辑能力,支持服装试穿、商品细节展示、配饰佩戴、背景替换、动作调整等任务。商家可以围绕已有素材提出展示需求,也可以针对文字、背景等局部问题进行定向修改。

图 2 KwaiMind 编辑案例,涵盖服装、配饰、商品场景和通用图像编辑。
以电商卖点图为例,模型需要根据商品图与编辑指令调整背景和构图并进行文字的渲染,在突出商品视觉表现的同时,保持其外观、材质与关键细节的一致性。这些要求也考验模型的通用编辑能力。KwaiMind 在适配电商场景的同时,也展现出较强的通用编辑能力,在多个通用基准测试中均优于本报告中其他参评的开源模型。

图 3 KwaiMind 在四组通用编辑评测中均取得参评开源组最高总体得分。
四项智能体协作,维护约 180 万对高质量训练样本
电商素材规模庞大、来源多样,既需保障质量,也需适配不同任务。传统流程依赖反复筛选、修改和复核,成本高、效率低,标准也难统一。为此,KwaiMind 构建了多智能体数据引擎,将质量过滤、样本修复、定向补充与指令标注整合为统一流程,实现任务自动流转、样本状态可追踪。四类智能体分工如下:
- Filter Agent:预筛输入图像,复筛编辑结果;
- Generation Agent:根据诊断修复可恢复样本,补充覆盖不足的任务数据;
- Caption Agent:生成不同粒度的编辑指令;
- Coordinator Agent:维护样本状态与分布,统筹任务调度、流程衔接及重试。
系统同时引入 Human-in-the-Loop 机制,将低置信、高分歧样本交由人工审核,审核结果回流数据生产流程,兼顾处理效率与数据质量。

图 4 精选 SFT 数据的任务构成及代表性样本。
多智能体数据引擎从约 2,620 万对候选数据中构建并维护约 180 万对高质量训练样本,供 Continued Fine-tuning 阶段使用。进一步精选约 23.49 万对数据用于 SFT 阶段,包括 11.5 万对通用编辑样本和 11.99 万对电商样本。通用数据夯实模型的基础编辑能力,电商数据则围绕服装细节、商品展示和文字编辑等强化专项能力,共同提升模型的指令遵循度与图像美观度。
专项优化与多教师蒸馏,整合为统一基座
真实电商任务往往要求模型同时做好多件事:执行编辑指令、保留商品细节、写对文字,并生成更能吸引用户关注的画面。这些目标的优化难度和收敛节奏并不相同,直接混合训练可能产生干扰,依次优化又可能遗忘已有能力。
KwaiMind 为此采用了一套结合专项能力优化与多教师蒸馏的训练方案:在通用编辑能力之上,模型进一步强化视觉质量、商品一致性、文字准确性以及商业点击吸引力。再通过 DiffusionOPD 将不同专家的能力汇聚到统一模型。

图 5 训练框架与 DiffusionOPD 多教师蒸馏。专项教师在学生自身的去噪轨迹上提供指导。
DiffusionOPD 是一种在线蒸馏策略,由教师沿学生的去噪轨迹逐步指导,使能力迁移更贴近学生实际的生成过程。KwaiMind 将通用编辑、文字处理、商品细节保留与用户偏好整合到同一模型中,让一次编辑兼顾多项要求,例如更换背景时保留包装细节与文字,同时生成更符合用户偏好的展示效果。
Ecom-Bench:系统定义电商任务与评测体系
电商图像编辑需要明确的任务边界,也需要一套能够判断素材是否可用的评价标准。
为此,团队构建 Ecom-Bench,包含 11 项任务、1,100 个案例,每项任务 100 个案例。这些任务包含了虚拟试穿、服装细节、姿态调整等模特穿戴任务,背景替换、商品提取、卖点展示等海报相关任务,以及文字编辑、宣传语去除等文字任务。
围绕这些任务,Ecom-Bench 建立了由 6 个通用维度和 8 个电商专项维度组成的综合评价体系:
- 通用维度关注指令遵循、融合自然度、物理与光照合理性、非编辑区域保留、图像质量及整体美感;
- 电商维度关注检查商品身份、文字准确性、面料纹理、模特与姿态、服装合身度、抠图边缘、卖点传达及商品展示完整性。
每项任务选取 2 个通用维度和 2 个电商维度,按任务需求确定评价重点。下表是具体的任务测评维度分配:

表 1 Ecom-Bench 各任务的评价维度分配(对应技术报告 Table 5)
评分时,评审模型会结合参考图、编辑指令和生成结果,按照明确的评分标准,对四个维度分别给出 1-5 的整数分。

单个案例的综合分采用几何平均计算,使文字出错、商品身份偏移等关键缺陷更明显地影响综合得分,降低单项高分所掩盖的素材可用性问题。各任务得分为该任务 100 个案例综合分的平均值,总分再对 11 项任务等权平均。
如图 1 所示,在报告的评测设置及参评模型范围内,KwaiMind 的 Ecom-Bench 视觉总分位居开源模型第一。除了视觉质量,团队还通过 Ecom-CTR 评估生成素材的预测点击偏好。不同模型的输出进行排序,各模型进入前三名的次数累计为 CTR 分数,以衡量相对商业吸引力。KwaiMind 在这一指标上表现优越,体现了模型对素材可用性与用户偏好的兼顾。
下面是一些可视化对比素材,覆盖卖点展示、服装细节、服装展示和虚拟试穿。结合参考图与编辑指令,可以直观看到不同模型在商品素材生成方面的差异。

图 6 服装展示

图 7 服装细节图

图 8 卖点图

图 9 虚拟试穿
业务验证:素材生成到真实点击提升
为了验证 KwaiMind 在实际业务里的应用价值,团队启动了商品主图素材优选线上 A/B 实验。在实验中, KwaiMind 带来了约 2.44% 的实际点击率的相对提升。
在离线评估中,对于随机质量采样的商品图,KwaiMind 生成图的预估 CTR 高于原始商品图的比例,由训练前的 12.16% 提升至 37.41%;相较于未经优化的基线生成图,其预估 CTR 胜率达到 91.89%。
总结
KwaiMind 的推出,让我们看到图像编辑模型进入电商实际工作流程的更多可能。从试穿展示、背景调整到商品细节保留与文字修改,模型需要理解的不只是 “画面怎么改”,还有 “商品应该如何呈现”,以及 “什么样的内容更能吸引用户”。对于开发者而言,统一的编辑基座与配套评测体系,给电商应用和定制工作流提供了坚实的基础。对于商家和创作者而言,这些能力汇聚到同一个模型中,意味着减少反复制作与修改的成本,为创作想法与真实可用素材之间搭起了桥梁,也为尝试不同的商品展示方式留下更多空间。
未来,团队将继续扩展任务覆盖范围,提升专用奖励模型的稳健性,并增强组合编辑与多参考图编辑能力。随着模型能力持续完善并逐步融入日常创作工具,电商素材的生成、修改与优化有望变得更加便捷。KwaiMind 将继续沿着真实生产需求迭代,让模型既能准确呈现商品,也能更好地连接用户;让每一次编辑更贴近需求,让每一份创意更容易落地。
项目与 KwaiMind 技术报告现已发布:
- KwaiMind 项目: https://github.com/KwaiMmu/KwaiMind
- Technical Report: https://arxiv.org/abs/2609.26375
本文配图为 AI 生成及 AI 编辑示意图,仅用于展示产品能力,不代表真实人物、真实商品或实际商业案例。