启发学习:让大模型认知从外化到内生

栏目:互联网 | 来源:机器之心Pro | 2026-08-26 18:00

过去两年,大模型几乎重写了人机协作的默认想象:写代码、查资料、做分析,似乎都能 “一问即答”。但仔细看会发现,当下很多能力并不是模型自己长出来的,而是人为地在外面包了一层又一层框架。

人类先定流程、写 Skills、建知识库;参数继续变大,工具链继续变厚。Agent、Skills、Function Calling、RAG、Harness 轮番上场,把临时判断固化成可调用的工作流。这套做法有效,也撑起了眼下的繁荣。

问题在于,能力上限往往卡在脚手架上。换场景就要重写流程,换工具就要重排提示和权限。系统看起来更能干,知识却越来越多地挂在流程外面。另一条路更接近人类怎么学:复盘成败,把结构相近的问题连起来,把一次有效推理留到下次还能用。

现在主流方案多停在接口与检索,很少把 “经验怎么复用” 写进推理本身。外挂和算力人人都能堆,更难的是,让模型在新问题上自己调用旧经验。我们把这条路线命名为 “启发学习(Inspirational Learning)”,并把它集成到推理侧,取名 Isaac(源自牛顿的名字,寓意 “站在巨人肩膀上”)。

人类智慧如何进化:

从旧经验里 “启发” 出新知识

近现代科学史里,重大突破很少从零开始。例如,库仑受牛顿万有引力思维模式启发,提出库仑定律;霍兰德把达尔文自然选择的逻辑迁移到计算机领域,遗传算法随之出现。最常见的路径,是把已知结构搬到新领域:类比、迁移、再重组。

图 1-a:库仑受牛顿万有引力思维模式启发,提出库仑定律。

图 1-b:霍兰德借达尔文自然选择逻辑,发展出遗传算法。

启发学习:认知的进化飞轮

图 2:启发学习的认知进化飞轮。类比检索、逻辑重组、内生注入与经验沉淀形成闭环。

图 2 给出了启发学习的四个步骤:类比检索(Analogical Retrieval)、逻辑重组(Re-composition)、内生注入(Endogenous Injection)和经验沉淀(Experience Loop)。面对新领域、新问题,检索聚焦的不是字面相似的文本,而是经验库里其它领域解答过的类似问题的思路;注入阶段把这些思路整理后合并进当前输入;沉淀阶段再把新题的思维链抽象成可复用条目,写回经验库。我们把该流程集成形成推理侧框架 Isaac:不改基座权重,也不重新训练,只在推理时注入跨领域经验。模型还是原来的模型,但解题时旁边多了一批 “结构相近的旧题” 来做指导、做参考。

技术底座:

Prompt 注入与网络层注入

要把启发学习跑起来,先得说清经验从哪里输入模型。团队把它拆成两条路,Prompt 注入:基座参数不动,把检索到的跨域示范写进上下文,让模型在给定示范下推理。网络层注入:基座仍冻结,但在中间层隐状态上加一个可训练的轻量适配器,用残差方式改表征,减轻源域与目标域的分布差距。对应团队提出的工作分别是域不变神经元检索(DIN-Retrieval,下称 DIN)和思维链引导的域适配(CoDA),合在一起构成 Isaac 的方法底座。

图 3:DIN 框架(Prompt 注入)。识别域不变神经元,构造 DIN 向量并检索跨域示范,再写入上下文提示。图片来源:DIN-Retrieval 论文。

DIN 做的是 Prompt 注入,核心是示范怎么选。源域有标签、目标域无标签时,先对隐状态做 token 均值,再按源、目标联合分布算神经元级 z-score;两侧激活极性一致、且超过阈值的维度,称为域不变神经元(必要时只保留幅度最大的前 K 维)。只用这些维度构造向量,在子空间里用余弦相似度找源域示范,并用 MMR 去掉太像的重复样本。示范与目标查询拼成提示后送进冻结基座。这样一来,跨域检索不再只靠文本嵌入是否相近,而是看域更稳的子空间里结构是否对齐。

图 4:CoDA 框架(网络层注入)。轻量适配器以残差方式调制中间隐状态;均方误差蒸馏源域思维链教师态,MMD 对齐源域与目标域增强表征。图片来源:CoDA 论文。

CoDA 做的是网络层注入。只把示范塞进提示,有时不够:源域和目标域差得大,共享推理模式仍难复用。做法是把冻结大模型按层拆开,前面抽特征、后面生成,中间插适配器,残差调制隐状态(增强态 = 原隐状态 + 适配器输出)。源域用 “问题 + 思维链” 得到教师隐状态;源域与目标域的原输入经适配器后得到学生增强态。训练两项损失一起优化:均方误差让源域增强态靠近教师态,MMD 对齐源、目标增强态分布。推理时基座仍冻结,只对目标输入过适配器,也不需要目标域思维链标注。和纯检索式上下文学习相比,这一步把迁移做到了中间表征上。

图 3、图 4 分别对应两条路:DIN 负责找对齐的示范并写入提示;CoDA 在隐空间里对齐推理相关表征,服务无标签目标域。可以先检索再适配,也可以按能不能训中间模块、能不能读隐状态,二选一。Isaac 把它们放在推理侧:基座权重不变,靠 Prompt 注入和(或)网络层注入复用旧经验。下面先看评测设置,再看增益。

评测基准:编程、推理、科学问答与科研编码

实验用了四个公开热门基准,用以全方位评价启发学习的解题能力,特别是解难题的能力。HumanEval 测函数级代码生成:按函数签名与说明补全 Python,用单元测试判对错。StrategyQA 测隐式多跳推理:题是是非题,但不写出推理步骤,模型得自己补策略。ScienceQA 测科学问答:题来自中小学科学课,多为选择题,部分带图。SciCode 测科研编程:题从真实科研流程拆成子任务,要把领域知识写成能跑的代码。四个任务覆盖编程、策略推理、科学问答和科研代码,后面的对比都基于这套设置。

从数据里各摘一例,方便对照题型:

HumanEval(HumanEval/127)-- 实现 intersection (interval1, interval2):判断两闭区间交集长度是否为素数,返回 “YES” / “NO”。例如 intersection ((-1, 1), (0, 4)) 应返回 “NO”。

StrategyQA -- Does citrus grow well in places with 24-hour days in the summer?(答案:no)。题面是是非题,但不给推理步骤,需要自己补出 “极昼地区的气候与光照是否适合柑橘” 这类隐含链条。

ScienceQA -- Which better describes the Daintree rain forest ecosystem? 配图选择题。选项有 “全年温暖、生物多样” 和 “冬季寒冷、土壤肥沃” 等;正确答案是前者,要结合图像与选项判断。

图 5:ScienceQA 示例题配图(Daintree rain forest)。题目要求判断哪一项更准确地描述该生态系统。

SciCode(problem CG) -- 实现共轭梯度法 cg (A, b, x, tol),求解对称正定线性系统 Ax = b。任务拆自真实数值计算流程,输出需通过数值测试。

实验效果:标准基准上的增益

我们对比了主流大模型的零样本接口与接入 Isaac 后的表现。HumanEval 上,Claude 达到 100.0%(公开榜首约 95.1%);StrategyQA 上,Qwen3-8B 达到 82.3%,接近公开 SoTA;ScienceQA 上,Doubao 达到 98.0%(公开榜首约 91.3%);SciCode 等科研编程任务上,多家模型也有稳定正向增益。

按模型看,增益并不均匀。同一套接入方式下,较弱模型的绝对提升往往更大:StrategyQA 上 Grok-4.5 提高 13.5 个百分点,ScienceQA 上 Gemma-4-31B 提高 12.7 个百分点,HumanEval 上 14B 级模型提高 8.5 个百分点;更强的模型仍可能继续抬高上限。

以上实验数据说明,大模型提质不见得只靠预训练或后训练侧的 scaling。在推理侧复用跨域经验,也能大幅提高任务性能,是一条与堆参数、堆算力并行的路线,也是一条可单独检验的路线。

图 6:跨模型零样本(灰)与接入启发学习 / Isaac(蓝)后的增益。a,StrategyQA;b,ScienceQA;c,HumanEval;d,SciCode。图片来源:Inspirational Learning Pitch Deck。

从会补证据,到会复盘、会举一反三

启发学习想解决的,不是再给模型多接一个工具,而是让它在新题上复用旧经验。现有多个基准上,这条路带来了跨模型、跨任务的大幅增益,我们相信,该方法可以在更广泛的任务上普适和泛化。

外挂和算力还会继续加,与此同时,更值得做的是把复盘和举一反三做成稳定能力,将大模型的认知从外化迁移到内生,让模型激活自身的学习能力,实现真正的自我进化,这也是我们认为启发学习能为整个 AI 行业做出的贡献。

团队文章:

  • https://arxiv.org/abs/2604.05383
  • DIN:通过前向激活识别源域目标域中的领域不变神经元实现跨域检索及上下文知识迁移
  • https://arxiv.org/abs/2604.05396
  • 系统性验证了跨域上下文知识迁移在纯文本推理任务中的存在性
  • https://arxiv.org/abs/2604.19488
  • CoDA:用源域目标域数据训练额外轻量网络并在推理时进行激活干预实现在模型网络层维度的跨域知识迁移

作者简介

颜见智, 2022 年获得吉林大学概率论与数理统计专业硕士学位,现为哈尔滨工业大学和鹏城实验室联合培养计算机科学专业博士研究生。研究方向主要集中在、统计机器学习、大模型压缩及大模型推理优化等领域,已在 ACL 和 EMNLP 上发表了多篇论文。邮箱:yanjzh@pcl.ac.cn

了解更多

猜你想看

← 返回首页