编辑|Panda
8 月 24 日,的Wan 3.0视频生成模型在千问创作 PC 端和千问 App 正式上线。同期出现在千问创作里的还有Agent Teams创作模式:用户提一个想法,一组分别扮演编剧、导演、美术、分镜师、配乐师的 Agent 自动组队,接力把它做成影视作品。

承载这两者的「千问创作」是千问近期上线的 AI 创作平台。它的定位是面向专业创作者的创意平台:Wan 3.0 及其满血的 Prime 版在这里全网首发,Prime 版生成更快、效果也更进一步;视频模型外,平台还汇集了Qwen-Image-3.0等阿里顶尖模型,视听两端的素材都能就地解决。产品侧则提供画布工作流与多种专业 Agent,AI 短剧、漫剧、营销广告、图像设计可以在同一个工作台里一站式完成。
是的,千问创作把模型、素材和流程装进同一个工作台。单看 Wan 3.0,这是一次模型升级,单段直出 30 秒、参考、更低的单秒价格。单看多 Agent 协作,这是 Agent 范式在又一个场景里的延伸。两者相加,意义却非同寻常。
因为对专业内容生产来说,眼下卡住效率的环节,已经不是单条视频的质量了。卡脖子的是搬运。
做过 AI 短剧的人大概都熟悉这套流程:一部三分钟的短剧拆成三四十个镜头,剧本在聊天窗口里写,角色四视图在生图工具里抽卡,分镜表落在表格里,再逐条把镜头描述翻译成提示词喂进视频模型;回来发现某个镜头中角色换了张脸,就得回上游改参考图,把下游重跑一遍。配音配乐在另外两个软件里,最后还要进剪辑软件对时间线。AI 在这里承担的是一个个孤立的工位,把工位串起来的人干的其实是
制片主任的活。生成不难,难的是让几十次生成之间保持连续性。
这几年视频模型的能力提升很快,时长、画质、音画同步、角色一致性几乎每个季度都在刷新,但能力上限的提高并没有等比例地转化成生产效率。要完成一部短剧,还需要剧本结构、角色设定、分镜规划、跨集统筹和后期剪辑,这些工作量不随模型变强而消失,反而因为生成变便宜、可选项变多,管理成本还上升了。
行业已经意识到了这一点,昆仑万维和字节跳动都在做这方面的平台。整体来看,竞争的重心正在转向,目标正转向「把一次完整的内容生产组织起来」。千问创作这次把自研视频模型、自研图像模型和 Agent 编排装进同一个产品,是这条路线的一个最新样本。

Wan 3.0:先把单镜头的上限抬高
要实现有效的多 Agent 协作,前提是每个工位的产出质量足够高。否则再精巧的分工,也只是把废片的产生速度提高了。
视频生成方面,千问创作接入了Wan 3.0视频生成模型及其Prime 版,而 Wan 3.0 这一代的升级方向,目标就是要让生成结果可以直接使用。

首先是时长。单段最长 30 秒,意味着一次人物出场、一轮完整冲突或一段产品演示可以放在同一个镜头序列里生成,而不必用多个 10 秒片段来回拼接。须知,拼接是一致性问题的主要来源之一:换脸、道具漂移、环境音断裂、情绪重启,大多发生在接缝处。因此,时长的一大核心价值就是把接缝的数量降下来。
其次是参考的丰富度。除文本、图片、音频、视频四种基础模态外, 还支持 doc、xls、ppt、pdf、md 等文档格式输入,也支持网页链接。这一条在专业场景里的意义很大:广告片有品牌视觉规范文档,科普片有原始论文或 PDF,企业宣传片有产品手册。能直接读这些材料,等于把「人工把需求写成提示词」这一步省掉了一部分。
第三是一致性与镜头语言。Wan 3.0 在角色长相、场景布局、服装道具、声音和画面风格等维度支持像素级控制,可复刻参考资产,并能驾驭推、拉、摇、移等镜头运动,通过镜头切换和蒙太奇推进剧情。在第三方创作者的公开测试里,20 至 30 秒的短剧片段确实能在特写、全景、肩后镜头之间切换而不崩人物,暗场和大幅运动下的服装、站位也基本稳定。

Wan 3.0 的价格也极具竞争力。Wan 3.0 的 API 标价为 480P/720P/1080P 分别 0.3/0.6/1.2 元每秒;据千问方面提供的信息,会员限时 4 折起,720P 单秒低至 0.26 元。对需要靠量取胜的短剧、漫剧和信息流广告来说,单秒成本直接决定了废片可以承受多少次。
关于 Wan 3.0 的更多介绍可以观看我们之前制作的实测视频:

图像侧的搭档是 7 月 21 日发布的Qwen-Image-3.0,支持最大 4.5k token 超长输入,可一次生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解与复杂 UI 界面,并支持 12 国语言和 20 多款字体原生渲染。其提示词长度较前代提升了 4.5 倍,其一大重要应用场景正是影视短剧分镜:创作者可以像写需求文档一样完整描述画面结构、文字内容和排版细节。

当然,你也可以选择满血版Qwen-Image 3.0 Pro,生成效果更佳。
对视频流程来说,这一条很关键。角色视图、场景参考图、道具图、分镜草图,这些都是视频生成之前必须先固定下来的资产。图片模型的可控性越高,视频阶段的抽卡次数就越少。
Agent Teams:从「写提示词」到「派活」
Agent Teams要解决的是前面那个搬运问题。
它的交互起点只需一句自然语言。用户提出创作想法,系统自主拆解任务,把不同环节分派给承担导演、编剧、视觉设计、分镜师等角色的子 Agent,围绕剧情、人物、视觉风格和镜头表达展开协作。

千问创作的「人才市场」已经预置了 59 个 Agent,包含不同风格的导演、美术、编剧、歌手等,用户也可以根据需求自行创建新的 Agent
千问创作把这称为「自动组队」。后续的创意策划、脚本撰写、角色设定、分镜设计、画面生成、配音配乐直到成片制作,由这组 Agent 接力完成,用户可以在对话框里介入,修改创作方向。
网页链接和文档可以直接作为参考进入项目,当前附件支持 PDF、Word、TXT、Markdown 和 Excel 等。产品形态上,千问 PC 端和移动 App 端均提供了直达入口,Web 端也可通过 c.qianwen.com 直达。各端创作资产和项目互通,可以中途换设备继续。
实测:我们做了一部「JoJo 的奇幻买瓜」
我们给出的需求非常简单:一段「华强买瓜」的文字剧本,外加一句提示词:「将这个剧本做成视频,视频风格参考《JoJo 的奇妙冒险》」。没有分镜,没有角色设定,没有画幅要求,就是一个普通用户提需求的样子。
千问创作 Agent Teams 接手后的第一件事是派出创作助手,而这个助手先做了一轮任务分析,然后抛出了一个问题:视频要什么画幅比例?这恰好是我们在提示词里疏忽的参数。把「需求补全」放在任务拆解之前,比拿着残缺的需求一路跑到底要省事得多。

确认之后,创作助手把任务做了更细一层的拆解,并给出一份组队方案。这部片子需要四个工位:导演、插画师、视频师、剪辑师。

再次确认后,四个 Agent 正式加入项目。到这一步为止,我们输入的全部内容,仍然只有最开始那段剧本和一句话。

接下来是各司其职的接力。第一棒是导演,它把原始剧本拆成 11 个剧情点,并写出了一份完整的讲戏本。每个剧情点的情绪落点、人物动机、镜头意图都交代清楚。这份讲戏本本身就是流程被收拢进同一个上下文的证据,是下游几个 Agent 共同的参照物。


然后是插画师开工,产出角色与场景的视觉资产。

真别说,有那味儿了。这一步的产物是一份可以被下游反复引用的角色资产;后面十几个镜头的人物一致性,都锚在它们身上。
有了角色素材,轮到视频师逐镜头生成 JoJo 风格的片段。但它没有直接开始烧算力,而是先写了 12 条镜头提示词摆到我们面前,等待审阅和修改。

这里我们也能看出来千问创作 Agent Teams 的一大关键设计:Agent 之间传递的并非一段自然语言的转述,而是一份份可读、可改、可回滚的结构化中间产物:讲戏本、角色资产、镜头提示词表。它意味着这是一条每个工位都有明确交付物、且每份交付物都对人开放的流水线。
提示词示例:

同时,「先出提示词、再等确认」的逻辑也非常实用,毕竟视频生成是全流程里最贵、最慢的一步,一旦 12 条全部跑完才发现方向偏了,返工成本是最高的。把人的判断插在生成之前而不是之后,比多加几个自动化环节更实用。
说实话,这批提示词写得已经相当完整。但为了试出这套体系的韧性,我们决定强行加戏,提了一条修改意见:「将华强骑乘的重型摩托车改成有些残破的小电驴」,并从原版视频里截了一张小电驴的照片作为参考图丢了进去。与此同时,我们还把视频模型从 Wan 3.0-720P 切换成了 Wan 3.0-1080P。

这一下同时动了三个东西:镜头内容、参考资产和底层模型,这个 Agent Team 都稳稳接住了。
接下来就是成本最高的环节:视频生成。

12 条片段全部生成完成后,剪辑师上场,把它们拼接成了一段完整影片:

创作助手随后给出了整个项目的总结。

当然,须得承认,这一版成品并不完美,仍有不少瑕疵。但这恰恰是 Agent Teams 与「一键生成」类产品的分野所在:项目并没有在成片那一刻结束。我们可以退回到镜头生成环节,直接 @ 对应的智能体与之对话,单独重做某一段,而不必推倒重来。

下面是我们只微调了三个片段之后的新版本:

效果明显好了一截,而且这个优化过程是可以一直迭代持续的。
整体跑下来,我们的判断是:这套流程确实能把一个只有剧本和一句话的需求,推到一部结构完整、风格统一的成片,中间不需要在多个软件之间来回搬运资产。但它不是「一键成片」,从「能跑通」到「能交付」,仍然隔着人的验证和多轮优化。
这一点值得再往下想一层:为什么偏偏是视频这个场景,让多 Agent 协作看起来跑得通?
为什么是视频?
跑完这一遍,我想聊聊视频这个场景本身。
多 Agent 协作这个范式,过去一年在很多方向上被试过,落地效果参差不齐。回过头看,它跑得比较顺的地方有一个共性:任务本身已有成熟的分工协作范式。
视频制作也正好满足这个条件。编剧、导演、美术、摄影、剪辑、配音,每个工种的职责边界、交付物格式、上下游接口,在电影工业里被打磨了一个世纪。Agent 的分工不需要重新设计,照抄剧组编制就行。分镜表天然就是一种结构化的中间产物,角色设定天然就是一份可复用的资产规格。相比之下,很多被硬拆成多 Agent 的任务,其实一个人就能干完,拆开反而会增加沟通成本。
但视频也有它特有的难处,而且这个难处恰好会在多 Agent 体系里放大。
代码类 Agent 之所以能自主迭代,是因为可使用编译器和测试用例来进行测试,结果很容易验证。
视频则不然。一个镜头「好不好」是主观判断,「接得顺不顺」需要人看完整段才知道,「感觉对不对」更是无法形式化。没有可以量化的验收标准,Agent 之间的接力就只能默认上游的产出是对的,错误会一路向下游传导,直到人在成片阶段才发现。
也正因为此,用户能在哪些节点介入、介入之后改动能否向下正确传播,或许比自动化程度本身更重要。回头看,Agent Teams 把讲戏本和 12 条提示词摆到用户面前等待确认,与其说是产品的贴心,不如说是这个场景的必然。
从这个角度看,Agent Teams 这类产品当下的真实价值,可能不在于「全自动」,而在于它把原本散落在十几个工具里的流程收拢进了一个上下文里。同一个项目里,剧本知道角色设定,分镜知道剧本,生成知道分镜。人不再是唯一的信息搬运工,而是来到了一个更接近导演的位置,只需提要求、看样片、下判断。
一个人能不能做出专业成片?
把「专业」拆开看,专业成片至少包含三层:技术可用性,画面不崩、声音同步、时长达标;叙事完整性,有结构、有情绪推进、有钩子;以及商业可交付性,符合品牌规范、能过审、能按时按预算交付。
第一层模型已经基本解决,第二层是 Agent Teams 这类产品正在解决的地方,方向对不对要看接力质量,第三层是反复修改、精确对齐需求、在有限预算内控制废片率;这一层目前仍然高度依赖人。
过去两年,AI 视频的竞争叙事一直围绕模型指标展开:谁的时长更长,谁的一致性更好,谁的单秒更便宜。这些依然重要,Wan 3.0 这一代的进步也确实落在这些维度上。但当单条视频的质量逐渐逼近可用线,差距会转移到流程的组织方式上去。
把编剧、导演、美术打包成一支可以被一句话调度的队伍,是对这个问题的一种回答。它还有很多没有被验证的边界,但这个方向看起来确实大有可为。
想上手的话,直接前往千问创作 PC 端 c.qianwen.com 即可开始(第一个 c 意为 create);也可以用千问 App 远程操控,创作资产与项目在多设备间互通,随时接着上一次的进度往下做。