当AI幻觉开始操作电脑:深大、港科大提出ECA,让Agent行动前先验证证据

栏目:互联网 | 来源:机器之心Pro | 2026-09-14 15:08

让 AI 帮忙发一封邮件,它可能把正文写得妥帖、附件整理得齐全,最后却发错了人。

问题出在更早的一步:它读错了邮箱地址。之后的流程越顺畅,这个错误反而越容易一路通过,直到邮件发出。

如今,桌面助手和浏览器 Agent 已经能连续操作多个应用,替用户整理文件、填写表单、处理工作。人们把更多步骤交给 AI,也就更少有机会逐项检查它读到了什么、据此作出了什么判断。

一次幻觉,开始有了真实的执行后果。

深圳大学和香港科技大学的研究者将目光放在了这个环节。他们提出 ECA(Evidence-Carrying Multimodal Agents):模型负责提出动作,独立的验证程序负责提供依据,工具在证据通过检查后执行。

这项工作的出发点很直接:当模型说「地址已经确认」「这个网站可信」时,运行系统应当拿到相应的证据。

  • 论文:Hallucination as Exploit: Evidence-Carrying Multimodal Agents
  • 作者:Guijia Zhang、Hao Zheng、Harry Yang
  • 论文地址:arxiv.org/abs/2605.19192

一个错误前提,可以带偏整条任务流程

过去谈到 AI 幻觉,我们往往关心它有没有编造事实:图片里是否真的有那件物体,文档里是否真的出现了那个数字。到了 Agent 场景,同一个错误还要继续往下追,看看它影响了哪个动作。

认错图片中一件衣服的颜色,可能只会留下一个错误描述。认错账单上的收款方,却可能改变一笔付款的去向。错误本身有多小,并不能说明后果有多轻。

论文将这种现象称为「幻觉到行动的转化」(H2AC):模型生成或采信了一个缺乏支持的判断,随后把它当成执行动作的前提。

这条路径尤其隐蔽的地方在于,模型可能一直在遵循用户的要求。页面不必出现「忽略之前的指令」这样的攻击语句。一个看起来可信的地址、一处被误读的字段,就可能让后续操作走偏。

在论文的授权轨迹回放中,仅靠提示词防护时,指令注入类任务的不安全动作率为 51.0%;错误前提驱动的任务则达到 85.7%。当模型没有接到恶意命令,而是相信了错误的信息,指令过滤就很难发现问题。

ECA 因此把检查对象细化到了每个动作。点击之前,确认按钮是否存在、是否符合当前任务;发送之前,核对收件人、用户意图和附件权限。任何一项关键条件,都需要有自己的依据。

页面写着「官方」,就能把文件交给它吗

这个例子可以说明 ECA 怎样工作。

模型看到一个写着「官方入口」的网页,准备上传用户的文件。OCR 也准确识别出了这四个字。到这里,系统确认的是页面上出现了什么文字;网站的身份,还需要通过浏览器来源信息和外部维护的可信名单来核对。

页面上的文字,不能替页面的身份作证。

ECA 为这两类信息保留了不同的位置。多模态模型接收网页、截图和文档,理解任务并提出工具调用;另一组职责明确的验证器回到原始内容中提取证据。

网页结构(DOM)用于检查按钮和链接,OCR 核对图像中的文字,无障碍树提供控件名称和角色。每份结果都记录具体的值、所在位置、来源、核验程序和可信级别,形成论文所说的「证据证书」。

模型可以解释为什么要点击一个按钮,但按钮是否存在、来自哪里,需要由这些记录证明。

图 1|ECA 架构。模型提出动作,独立验证器出具证据,门控程序检查执行条件。来源:原论文 Figure 1,第 1 页。

最后作决定的是一个按固定规则工作的门控程序。它将动作所需的条件与证据逐项匹配:条件满足就放行;证据尚不完整、适合进一步核实时,补充证据或请用户确认;信息冲突或缺少必要来源依据时,停止执行。

这样,执行接口收到的就不只是一句「可以发送」,还有支持这次发送的具体记录。模型对自己的判断再有把握,也不能用一段文字代替这一步核验。

研究团队还测试了另一种常见做法:让大模型充当安全审核者,并尝试结构化推理、多次投票和多轮审议。在 200 个 AgentDojo 任务上,增强方案中表现最好的多轮审议版本,仍放行了约 79.3% 的不安全动作。

图 2|GPT-5.4 安全裁判的不同配置。UAR 为不安全动作率,ASR 为攻击成功率,Benign 为正常任务成功率。基础裁判使用 500 个任务,其余配置使用 200 个 AgentDojo 任务。来源:原论文 Table 13,第 20 页。

研究者观察到,审核模型会采信规划模型对前提的描述。两者面对同一份受操纵的观测,可能得出相同的错误判断。ECA 引入的独立证据通道,则要求这项判断在执行前得到外部核验。

放进浏览器之后,检查能否真正起作用

团队围绕网页导航、文档提取和邮件编写,构建了 200 个任务,让系统完成从内容提取到动作授权的整套流程。其中,140 个不安全动作全部被拦下,60 个正常任务全部完成。

随后,他们将 ECA 接入 Chromium 浏览器。在 120 个任务中,85 个不安全动作均未获准执行;35 个正常任务中,30 个直接放行,5 个转交用户确认。

图 3|各层次实验及对照方法的授权结果。表中分别列出验证器红队测试、内容提取实验、假定证书正确的回放,以及模型裁判结果。来源:原论文 Table 1,第 6 页。

验证器本身也是攻击目标。团队构造了来源伪装、形似字符、虚构控件等攻击,逐项加固证据提取环节。在加固后的 1,700 个标准攻击实例中,没有一次绕过门控。

其中一个细节很有代表性:部分攻击骗过了无障碍树验证器,却被 DOM 的交叉检查发现。多条证据通道在这里发挥了实质作用 —— 一处信息失真,可以由另一处核验结果拦住。

团队还在六个外部基准的 7,488 条授权轨迹上进行了回放,使用假定正确的证书,单独检验门控规则。完整流程、浏览器测试和验证器攻击测试,则进一步检查了证据从哪里来、会不会出错,以及能否支持实际操作。

多一道检查,用户要多等多久

对日常使用来说,频繁弹出确认框也会消耗耐心。研究者因此把 ECA 带到 16 个真实网页上,测试了 452 次目标明确的正常点击。这些网站已在可信名单中,包括百科、新闻、开发文档等页面。

最终,423 次点击直接放行,占 93.6%;另外 29 次请求用户确认,没有正常点击被直接拒绝。

需要确认的情况主要出现在动态页面上:屏幕中已经显示的链接或按钮文字,与静态解析得到的内容不完全一致,导致元素证据不完整。系统会在这类具体问题上停下来,等待补充依据。

在同一组复杂网页上,完成页面信息提取、截图、文字识别和门控判断,耗时中位数约为 0.66 秒,最慢约 3.2 秒。主要开销来自 OCR 和截图,这也指出了后续优化应当着力的环节。

ECA 为 Agent 增加了一道执行前的核验:模型提出动作,独立验证器提供证据,门控程序逐项检查所需条件。从网页操作到邮件发送,系统都要回答同一个问题:这次行动的依据,是否经得起核对?

我们把任务交给 Agent,是希望它能把事情办妥,而不必时时盯着屏幕。一次点击、一封邮件、一份提交出去的文件,都需要系统在执行前核实依据。ECA 将这项工作放进了运行流程,让用户少承担一些事后发现错误、再设法补救的麻烦。

作者简介

本文研究由深圳大学与香港科技大学合作完成,团队成员包括 Guijia Zhang、Hao Zheng 和 Harry Yang。

Harry Yang 是香港科技大学跨学科学院助理教授,目前正在开展 Digital Neural Alive 相关研究。

了解更多

猜你想看

← 返回首页