推荐系统只会「猜你喜欢」,却未必「听你的」?我们用多智能体给黑盒推荐做了一次外部可控性体检

栏目:互联网 | 来源:机器之心Pro | 2026-07-30 22:48

该研究作者团队来自中国科学院信息工程研究所智能认知安全实验室,主要研究智能算法、大语言模型、多智能体系统及其安全。

打开视听平台,系统决定你接下来看到什么;进入购物软件,系统预测你可能购买什么。过去几十年,推荐系统主要关注 “能否更准确地预测用户下一步喜欢什么”。但当用户希望探索小众内容、调整兴趣结构或摆脱热门推荐时,系统是否会响应?

一个推荐系统可以很会 “猜你喜欢”,却未必真正 “听你的”。为此,我们提出CtrlBench-Rec:一个面向黑盒推荐系统的多智能体外部可控性评估框架。它不访问模型参数、梯度、召回逻辑和内部用户表示,仅通过搜索、点击等外部行为,测量系统能否被用户引导。

  • 论文标题:Can We Steer the Black-Box? Towards Controllability-Centric Evaluation of Recommender Systems with Collaborative Agents
  • 作者:Jiwen Zhou*, Xiang Liu*, Mingming Li†, Pengbo Mo, Jiao Dai, Honglei Lv†, Jizhong Han, Songlin Hu
  • * Equal contribution, † Corresponding authors
  • 作者单位:中国科学院信息工程研究所、网络空间安全学院
  • 论文地址:https://arxiv.org/pdf/2607.13418
  • 代码地址:https://github.com/caskcsg/CtrlBenchRec

推荐系统评估缺少了什么?

Recall、Hit Rate 和 NDCG 等传统指标主要衡量模型能否根据历史准确预测下一次交互,能够回答 “系统猜得准不准”,却难以判断外部用户能否引导设置控制推荐算法。

外部可控性关注的不是一次排序结果,而是推荐系统在连续外部行为作用下的响应过程:用户需要多少轮交互才能推动系统改变推荐方向?哪些内容可以被引导出来?哪些兴趣能够被塑造?哪些长尾区域即使持续交互也难以触达?

与需要访问模型内部结构的白盒可控方法不同,CtrlBench-Rec 将推荐系统视为完全不透明的黑盒,只利用系统对外提供的推荐和交互接口进行评估。

如何测量外部可控性?

论文设计了三个递进任务:

  1. 目标内容发现考察外部行为能否使系统持续暴露指定内容;
  2. 兴趣画像塑造判断外部行为能否改变推荐结果所反映的兴趣结构;
  3. 流行度偏置缓解检验用户能否推动系统减少热门内容依赖并进入长尾区域。

三个任务分别对应显式目标、隐式兴趣表示和系统内生偏置,构成对黑盒推荐系统外部可控性的分层测量。

多智能体如何成为评估探针?

单个 Agent 很难在有限预算内充分探索一个黑盒推荐系统。它无法观察系统内部状态,也无法提前知道哪些点击能够有效改变推荐方向。CtrlBench-Rec 因此采用广泛探索、行为聚类、协作融合的多智能体机制。

首先,框架根据真实用户属性和历史行为构造一批具有不同偏好的初始 Agent。随后,这些 Agent 分别进入黑盒推荐环境,通过搜索、点击和多轮推荐反馈积累交互轨迹。

完成初步探索后,框架对不同 Agent 的画像和行为轨迹进行编码与聚类,使具有相似策略、成功路径或失败模式的 Agent 进入同一组。组内 Agent 进一步交换交互经验,由用户画像融合模块提炼出更集中的控制策略,形成少量Super Probes。

这些 Super Probes 不会修改被评估的推荐模型,而是作为经过优化的外部探针,继续通过正常用户接口测试系统的响应能力。实验覆盖 MovieLens-1M 和 Amazon Toys & Games 两个数据集,并构建 NARM、SASRec、TwHIN-BERT、BGE 和 Qwen3.5-4B 五类黑盒推荐环境,主要衡量目标内容覆盖率和探索效率。

核心发现

第一,不同推荐架构的外部可控程度差异明显

在第 20 轮交互时,CtrlBench-Rec 在五种架构上的覆盖率均高于同规模随机探针:NARM 为 3.72%,SASRec 为 8.95%,TwHIN-BERT 为 12.07%,BGE 为 27.41%,Qwen3.5-4B 为 13.93%。其中,BGE 的绝对覆盖率最高,NARM 最低。外部可控性并不随模型参数规模单调增加,更可能取决于推荐架构、物品表示,以及目标语义与检索机制的匹配程度。

第二:不是所有目标内容都同样容易被外部引导

实验发现,即使处于同一个推荐系统,不同内容类别的外部可控性也可能相差很大。在 MovieLens-1M 中,Film-Noir 仅占全部物品的约 1.1%,最终覆盖率为 6.8%。这类极端长尾内容很少进入初始召回集合,用户即使持续表达兴趣,也可能缺少有效的交互路径。但类别规模并不是唯一因素。Romance 的物品数量明显更多,覆盖率却只有 6.4%,低于规模更小的 War 类别。论文认为,一些中等流行类别内部语义过于分散,缺少明确的表示中心,因此同样难以被持续引导。

这表明,外部可控性不仅受到流行度影响,也与目标类别在系统表示空间中的结构有关。

第三:增加交互次数,也无法无限提高外部可控性

论文进一步将交互预算扩展到 200 轮,以测试系统是否能够在足够长的外部引导下暴露全部目标内容。

结果显示,CtrlBench-Rec 的累计覆盖率在约 55.7% 附近逐渐饱和,并未继续接近 100%。这说明,外部可控性可能存在明确边界。一部分目标内容并非只是排序靠后,而可能由于召回缺失、表示稀疏或协同信号不足,在当前行为接口下接近不可达。更多交互可以帮助探针更快逼近这一边界,但无法保证突破推荐系统内部的结构性限制。

第四:少量明确行为即可启动外部引导

为了让推荐系统识别一个新 Agent,框架需要先注入一段初始行为历史。

实验比较了单次行为、4—6 次行为以及更长历史。结果显示,长度为 4—6 的简短行为序列取得了较好的覆盖率与效率平衡。

发现过短的历史难以提供足够的兴趣信号;过长的历史则可能使已有兴趣过于稳定,增加后续调整难度。这意味着,进行外部可控性测试并不一定需要复制用户完整的长期历史,少量语义明确的行为就可能足以激活系统的推荐机制。

第五:用户的兴趣画像可以被外部逐步塑造吗?

论文设置了三种兴趣塑造场景。

  1. 在简单兴趣塑造中,Agent 初始历史较短,目标相似度在前十轮内由约 0.53 上升到 0.61。
  2. 在多兴趣平衡场景中,系统需要同时响应多个兴趣维度,最终目标相似度超过 0.72。
  3. 在兴趣迁移场景中,Agent 已经具有一个与目标方向相反的强兴趣。系统在早期表现出明显历史惯性,但大约从第 9 轮开始,原有兴趣相似度持续下降,最终降至约 0.34。

这些结果表明,黑盒推荐系统的用户画像并非完全固定。持续、连贯的外部行为可以在一定程度上塑造推荐结果所反映的兴趣结构,但已有历史越强,转向所需的交互成本通常越高。

第六:长尾引导仍然是最难突破的瓶颈

在流行度偏置缓解实验中,CtrlBench-Rec 能够在早期阶段更快发现新的长尾内容。但随着交互继续,所有方法的绝对长尾发现量仍然较低,与随机方法之间的差距也逐渐受限。

这说明,更好的外部探针可以提高长尾探索效率,却无法仅靠用户侧行为消除推荐系统内部的流行度偏置。当长尾物品缺少曝光、语义关联和协同信号时,外部引导能够缓解问题,但难以完全突破系统底层的召回和表示限制。

这项工作的意义

CtrlBench-Rec 将推荐系统评估从静态预测扩展到了动态外部引导。传统指标主要衡量模型能否复现用户历史偏好,而外部可控性进一步考察:当用户目标发生变化时,系统是否能够响应,以及这种响应需要多少交互成本。

这一评估不依赖模型内部结构。对于无法获得参数、梯度和用户表示的线上推荐系统,研究者仍可通过外部接口测试其目标内容可达性、兴趣表示可塑性和对流行度偏置的抵抗程度。因此,该框架可用于不同黑盒推荐系统之间的可控性比较,也可作为算法审计和用户控制机制设计的基础工具。

多智能体在其中并非被用于直接优化推荐结果,而是作为评估仪器。不同 Agent 负责探索不同交互路径,协作融合模块再将分散经验压缩为高能力探针,从而在有限预算下更有效地暴露黑盒系统的响应能力和控制边界。

小结

推荐系统长期以来主要被视为一个预测问题:根据用户过去的行为,判断他下一步可能喜欢什么。

但当推荐系统成为信息分发基础设施,仅仅预测准确还不够。一个系统是否真正具有用户可控性,还取决于它能在多大程度上响应来自模型外部的目标、行为和意图。

实验表明,黑盒推荐系统并不是简单地 “可控” 或 “不可控”。其外部可控程度会随推荐架构、目标类别、历史状态和交互预算发生显著变化。一些兴趣能够在少量交互后被塑造,一些语义目标可以被持续推动;但极端长尾内容、分散类别和系统固有偏置仍然构成明显边界。

因此,推荐系统评估除了继续回答 “它能否准确预测用户”,还需要进一步追问:

当用户明确提出新的目标时,这个黑盒推荐系统能否被外部用户引导和控制?

了解更多

猜你想看

← 返回首页