创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频

栏目:互联网 | 来源:新智元 | 2026-09-18 07:40

新智元报道

AI完成任务之后,还能留下什么?

北京航空航天大学、香港中文大学和新加坡国立大学的研究团队最近发布了OmniHarness,给出的路径是:让视觉智能体主动练习、检查结果,再将有效流程留下。

面对下一个需求,AI手里能多一份经过验证的方法。

论文全文:https://arxiv.org/abs/2609.16057

项目主页:https://omniharness.github.io/

代码与运行说明:https://github.com/OmniHarness/OmniHarness

创意任务解决率95%

ComfyBench创意任务中,OmniHarness达到95%,超过表中最佳对照SymbOmni27.5个百分点。采用Codex GPT-4o配置时,总体解决率为92.5%。

表中的Pass看流程能否执行,Resolve看输出能否满足任务要求。

OmniHarness两种配置的Pass均为100%,ComfyMind和SymbOmni也已做到。区分它们的重点,是可运行的流程交出了多少合格结果。

将推理骨干同样设为GPT-4o,OmniHarness总体为89.5%,ComfyMind为83%;创意任务上,两者分别为95%与57.5%。

这让经验如何被调用、工具如何被组织,成为模型能力之外值得观察的因素。

采用Codex规划后,总体由89.5%升至92.5%,复杂任务由76.7%升至83.3%。不同规划配置,对应着不同的多步任务表现。

优势也有范围:复杂任务的83.3%仍未超过ComfyMind的85%,并非所有子集都领先。

这些成绩,落在怎样的画面里?

输入可以简单到一张花朵涂鸦。

涂鸦被重绘为写实红花,其风格又被用于生成一片花田。

两次生成通过中间图像连了起来。

换成四格漫画,任务变成讲完整个周日早晨:醒来、看手机、发现是周日,继续躺平。动作与文字都要服务剧情

换成海报和书封,主题、标题、版式又构成一组需要同时满足的要求。

餐桌编辑则更细:叉子要移除,或替换成勺子,旁边的食物、杯子与桌面布局还得尽量保留。

改好目标,也要顾及周围。

做成一次之后,怎样留住经验?

创作需求总在变。红花可能换成其他主体,重绘之后可能还要调整布局。一次成功怎样帮助下一次?

OmniHarness采用符号策略学习,将验证成功的流程整理成可用于一类任务的策略。

借花田任务理解:花朵与颜色可以替换,而先重绘草图、再借参考生成新画面的连接方式,可以成为可调整的方法。

保存的策略包含工作流模板、适用条件和资源依赖,当前图片、具体描述等实例输入则被抽离。

后续调用先检查是否适用,再绑定新输入,按要求调整步骤或组合多条策略。

出题、检查、积累

经验怎样转起来?

第一步,把练习选在值得探索的地方。

自主练习发生在下游任务明确之前。

只做熟悉的题,难以补齐空缺;挑战太远,又缺少方法支撑。系统结合练习记录与现有能力,让探索有迹可循。

每轮默认生成10道候选题,以新颖性和能力边界评分的乘积决定练哪一道:

本轮候选任务组成集合。

衡量是否少有练习,反映当前能力是否为探索提供适度支撑。

同类情境练得越多,新颖性得分越低:

包含任务需要的能力,记录相应“情境—能力”的练习次数。图生图以源图区分情境,文生图共享一个标记。

得分按所需能力取平均,避免能力项列得多就自然占优。

每项能力由适用、未停用流程中的最高可靠性提供支持;可靠性用95% Wilson置信区间下界估计。

整道题的能力估计取其中最低值:

这相当于先看短板:大部分步骤熟练,一处缺少可靠方法,仍会拖累整体完成。

随后把能力估计转成选题分数:

时得分达到最高;估计值趋近0或1,得分都会下降,练习因而偏向有基础但仍有挑战的任务。

表达能力支持程度,这套评分是选题启发式。

第二步,让检查跟上每次执行。

系统安排步骤和依赖,将代码编译成ComfyUI工作流,再检查流程能否运行、各步效果及最终目标是否达成。

以花田任务说明:假如红花已偏离要求,下一步继续沿用,偏差也可能进入新画面。

失败后,系统定位问题并局部修复,尽量保留已验证部分;需要时请子智能体协助,在重试预算内再次检查。

第三步,让成败都成为下一次的依据。

验证成功的流程被抽象入库,失败则记录证据、原因与修正方法。等价流程会合并,可靠性随调用更新,经验继续影响选题和执行。

策略还要接受后续检验。新的成败记录,继续影响它的可靠性与调用优先级。

经验换个使用者

还管用吗?

团队把自主练习后的策略库冻结,再适配到其他智能体的知识接口。宿主保留原有控制流程,模型也不微调。

交付的内容既有成功流程模板,也有失败证据与修正办法。其他智能体通过自身的检索、规划和执行机制使用它们。

同一份经验,让三个系统的总体解决率都提高了:

  • ComfyAgent由32.5%升至57.0%。

  • ComfyMind从83.0%提高到88.0%。

  • SymbOmni则由86.0%达到89.0%。

对应的创意任务增幅依次为27.5、17.5和10个百分点。

创意任务的提升均超过各自总体增幅。面对新要求,已有流程和纠错经验仍能为不同系统提供帮助。

还有一层迁移:只练过图像任务的冻结策略库,被用于视频工作流。

视频总体解决率为85.9%,高于表中最佳对照5.1个百分点;视频到视频达到80.0%,高出13.3个百分点。

其中,图像策略负责内容构建、参考保持等操作,时序处理仍交给视频专用组件,二者需经适配与组合。

一次任务结束

经验的使用才开始

这条路径同样需要付出计算成本:自主练习、多轮验证和修复都会增加开销,检索效率与推理预算仍有优化空间。

OmniHarness展示了一种积累方式:模型参数不变,可调用的方法随实践更新。

今天留下的经验,有机会成为明天处理新需求的起点。

参考资料:

https://arxiv.org/abs/2609.16057

编辑:LRST

了解更多

猜你想看

← 返回首页