让大模型真正学会「发现」,设计下一个实验

栏目:科技 | 来源:机器之心Pro | 2026-08-30 16:35

许多科学发现问题,本质上是在开放空间中面向特定奖励的决策问题。近期,伦敦大学学院汪军老师领导的团队发布了大发现模型(Large Discovery Models, LDMs),专门用于解决科学发现领域中 “如何设计下一个实验” 的问题。

LDM 是一套递归式的基础模型架构,核心是将生成式基础模型与高斯过程奖励模型相结合:基础模型依托历史信息与上下文,在开放空间中持续拓展、重塑当前的有效搜索空间;高斯过程则在该搜索空间内,基于实验历史构建贝叶斯奖励信号,评估各个候选方案用于下一轮实验的价值。LDM 能够依据实验数据与基础模型的上下文更新完成实时迭代,奖励信号也可以通过后训练融入基础模型参数,由此形成快、慢两套学习闭环。

  • 论文:https://arxiv.org/abs/2608.15669 Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search.
  • 项目网站: https://largediscovery.net/
  • 项目 GitHub: https://github.com/yzailab/Large-Discovery-Models
  • Hugging Face: https://huggingface.co/collections/Yangtze-ailab/large-discovery-model-v01
  • 提供反馈:https://largediscovery.net/feedback/

LDM v0.1 在 Auto-Research(神经网络训练)、抗体设计、多目标分子优化三个场景取得初步验证:

  • Auto-Research BPB 下降幅度是纯大模型反思的2.4 倍;
  • 抗体设计结合能相对纯大模型反思平均降幅达18.2%;
  • 分子多目标超体积相对纯大模型反思和贝叶斯搜索提升 >60%。

为什么科学发现需要另一种大模型

近年来,大语言模型已经从对话、文本生成,拓展到数学、代码等领域的复杂推理与问题求解。其中一项关键技术,是依托可高效验证的奖励信号开展测试时搜索(Test‑time search)或强化学习。但在科学研究场景下,实验反馈对应的真实奖励来源于机理复杂且尚未探明的高成本实验,同时设计或假设空间往往规模庞大,甚至具备开放性。

纯大语言模型拥有丰富的结构先验,可以编写代码、生成蛋白序列与 SMILES 表达式,但往往会将语言流畅度、生成似然度视作方案质量的评判标准,无法基于实验反馈校准自身的生成分布与不确定性;传统贝叶斯优化(BO)能够依靠后验均值和方差做出审慎决策,却通常局限于预先给定的有限搜索空间,很难探索全新模块、全新基团或是全新的序列家族。

图 1:大模型从生成、推理到开放式发现的演化。基于昂贵的黑盒实验评估,LDM 在开放式空间中不断迭代和改进实验设计。

Large Discovery Model(LDM)融合生成模型与贝叶斯优化两者的优势,搭建起完整的实验闭环:生成模型拓展候选方案的边界,代理模型为每一个候选方案输出可靠的决策价值。模型不仅会在已知范围内优化,还能够判断何时探索不确定性较高的区域,甚至提出过往候选集合中从未出现过的全新方向。

探索与利用之外,我们还需要 “发现”

图 2:从利用、探索到发现。真正的 “发现” 会把尚未被表示的区域变成可搜索的新区域。

我们对开放式设计空间的认知可以被划分进 “认知矩阵”:

  • “已知的已知”,指处于搜索范围内、性能已经被充分掌握的候选集合,可在该范围内通过利用(exploitation)寻找确定性的高质量解。
  • “已知的未知”,指已经纳入搜索范围,但性能尚不明确的候选集合,可在该范围内开展探索(exploration),实现由未知向已知的转化。
  • 而 “未知的未知” 完全不在当前搜索范围或模型的表征范围之内,这就需要依靠发现(discovery),把全新的领域纳入搜索范围。

传统序贯优化讨论 exploration–exploitation:利用是在已知高价值区域精修,探索是在当前表示范围内收集信息。LDM 进一步强调 discovery—— 当候选池饱和时,模型要改变表示本身,把新机制、新结构或新家族纳入搜索。

生成模型结合统计模型,快慢两个学习闭环

LDM 由生成模型与经验价值模型共同驱动。生成模型输出程序、蛋白序列、分子等开放式候选方案;高斯过程(GP)基于已获取的实验数据,估算候选方案的价值与不确定性,从中选出最值得开展评估的设计批次。

图 3:LDM 的完整学习回路。快环在每次实验后更新数据与上下文;慢环把高价值搜索轨迹蒸馏进模型参数。

LDM 基于以下核心公式来构建下一次提议的分布:

pθ,α 是大模型的生成先验,aₜ(x) 是 GP 奖励模型所导出的 acquisition value;θ 为大模型权重,α 为大模型推理参数,η 控制价值信号强度。该分布既保留生成多样性,又把实验预算推向更有价值的候选。

快学习闭环:用真实观测决定下一步

每一轮中,LLM 根据当前上下文生成开放式候选,灵活调整和扩张搜索边界;GP 用已观测数据,提供奖励的预期与不确定性。再通过 acquisition function(如 UCB、EI 或多目标 EHVI)给出实验优先级。高价值候选既可能表现更好,也可能显著减少不确定性。

  • 生成:LLM 提出结构化、开放式候选的基础分布
  • 筛选:GP 奖励模型基于真实观测构建采集函数,使基础分布向具有高实验价值的方向倾斜。
  • 实验:通过 Test-time search (TTS)选择高实验价值的候选,用于代价昂贵的实验评估
  • 更新:新结果写回数据与上下文,用于下一轮的实验决策

慢学习闭环:把高价值决策蒸馏进模型

快环解决单个任务中对于实验反馈的持续、快速适应,慢环则负责把 “基于经验提出新设计” 的元能力固化到模型参数中。LDM 保留 TTS 中的候选、搜索状态和采集函数值,构造按采集函数值加权的训练数据,从而通过 SFT 把 “何时利用、何时探索、何时跨出旧边界” 的策略蒸馏进生成模型。

慢闭环学习的不是静态高分答案,而是潜在的实验价值。即便某个候选方案当前预测均值并不高,只要它能够打开全新搜索区域、或是为后续搜索提供新信息,就依然具备优先开展实验的价值。

三类任务:LDM 是怎样在快闭环中 “发现” 的

论文在代码、抗体和小分子三类开放式设计任务上测试 LDM。重点不只是终点分数,而是它能否跨过平台、切换搜索区域,并形成新的候选家族。这三类任务的设计空间是完全不同的模态:

  • 代码:Auto-Research 可改变程序表示
  • 序列:2011 规模的 CDRH3 组合空间
  • 分子:开放式 SMILES 字符串空间,双目标 Pareto 优化

场景一|AutoResearch:从调参走向发现新训练机制

该任务的目标是,在固定硬件与训练时长约束下持续修改 NanoGPT 的 train.py 脚本,实现验证集 BPB 指标最小化。LDM 依靠大模型维护动态参数空间,有效参数空间会随着训练机制的迭代持续变化,同时搭建高斯过程代理模型,确定下一轮待尝试的方案。

图 4:Auto-Research 代表性轨迹。搜索先后引入 Muon optimizer、value embeddings、n-gram memory 等机制,平台期通过 reflection 改写候选方向。

该性能曲线并非固定空间内参数调优带来的平滑变化,而是伴随着新机制的发现,参数空间被持续改写。例如引入 Muon 优化器、value embeddings、n‑gram memory 等机制后,性能出现明显跃升;当搜索在 768 维附近进入平台期,反思模块将搜索方向切换至更窄的结构。在 H100 实验阶段,对比 Karpathy 基线 0.9767 的 BPB 数值,LDM 在相同初始条件下实现的 BPB 绝对降幅,是纯大模型反思方案的 2.4 倍。

切换至 B200 硬件后,LDM 主动拓宽参数搜索空间,BPB 进一步下降至 0.902291,在 Auto‑Research 排行榜取得世界第一,且性能大幅领先其他方案。

场景二|抗体设计:在 20¹¹ 序列空间中跳出局部最优

CDRH3 的序列包含 11 个可编辑位点,每个位点可在 20 种氨基酸中选择,整体组合空间规模达到 2011。论文针对 5 种抗原,各分配 200 次评估预算,以结合能作为评价指标(数值越低代表效果越好),验证模型能否在高度崎岖的序列空间中挖掘全新的基序(motif)家族。

图 5:对抗原 1NSN_S 的最终结果,数值越低越好。

综合五个抗原的实验结果,相较于纯大语言模型方案,LDM 的平均结合能降低 18.2%。生成模型负责拓展当前搜索的序列邻域,代理模型再通过采集函数完成筛选。大语言模型在这类专业空间中缺少充足数据构建先验,而高斯过程可以利用实验反馈弥补大语言模型在领域先验不足时的盲目生成问题;同时大语言模型对局部搜索范围做出约束,避免传统贝叶斯优化在超大序列空间内做无效探索。

场景三|小分子设计:跨骨架扩张 Pareto 前沿

在开放的 SMILES 分子字符串空间中,LDM 需要同时优化 KRAS G12D 的 docking 评分与神经网络活性预测。用帕累托前沿所支配的超体积衡量双目标下的综合表现,预算为 80 次评估。与边界明确的序列空间不同,有效 SMILES 无法穷举,传统搜索很容易停滞在局部化学家族或预先给定的搜索范围。

图 6:80 次评估后的平均 Pareto 超体积。

LDM 的帕累托超体积相对纯 LLM 反思提升 62.4%,相对传统多目标贝叶斯优化提升 63.1%。只有基础生成模型,候选缺少可靠的实验价值评估;只有贝叶斯优化,开放式结构创新不足。两者结合后,搜索才能在不同分子骨架之间扩张 Pareto 前沿。

模型从慢闭环中学到了什么?

如果只看任务内结果,LDM 仍可能被理解成一个更强的测试时搜索器。论文进一步把具有高采集函数值的生成策略蒸馏到 Qwen3.5-9B,比较基础模型、直接生成微调和带推理思维链(CoT)的微调,以检验慢环是否改善了下一轮搜索的提案质量。

9B 学生模型超过 30B 代码模型参考

图 7:nanoGPT 微调结果。带推理的 Qwen3.5-9B 经过微调优于 Qwen3-Coder-30B。

LDM 的微调并不是简单复刻最优搜索轨迹,而是学习如何依托历史数据与上下文,有效反思并输出具备高潜力的全新方向。实验结果表明,慢闭环可以在同等测试时搜索预算下,优化生成模型的候选输出分布。另外两项任务中也观察到相同规律。

跨任务泛化:学到的是答案,还是研究策略?

论文设置两级分布外(OOD)测试:训练时完全移除抗体设计任务,只用 Auto-Research 与小分子轨迹微调;随后,直接在抗体设计任务上对模型进行测试。

跨任务模型在 5 个抗原中的 4 个上接近或超过直接见过抗体数据的模型,说明 “如何基于经验提出新设计” 是具有一定跨任务迁移性的元能力。

失败同样重要:唯一明显失败的 1H0D_C 的原因在于其最优区很窄,需要构造特定芳香 / 疏水 motif;没有蛋白领域知识时,模型难以从零发现这种序列。慢闭环迁移的是管理认知不确定性并平衡利用、探索的能力,不会凭空迁移蛋白领域的 de novo 设计知识。LDM 把通用研究决策与领域生成能力分开,也暴露了两者各自的边界。

总结

LDM 为开放式科学空间中的实验设计提供了一种新的递归式基础模型架构。面对机制未知、成本高昂的实验反馈,LDM 能确定最值得尝试的下一步实验;当现有搜索范围达到饱和时,完成新区域的发现,持续调整、扩张搜索边界。

LDM 并不是简单拼接大语言模型与贝叶斯优化,而是将科学发现建模为两套不同时间尺度的学习系统:快闭环依靠真实实验持续校准模型;慢闭环把反复生效的决策策略沉淀到模型参数。

LDM 距离真正的自动化科学家仍存在一些差距:目前实验大多依赖仿真软件作为评估模拟器,而非真实实验室的湿实验结果;高斯过程在极高维、长时程、强非平稳的场景下会遇到可扩展性问题,针对不同模态的搜索空间,还需要针对性设计高斯过程核函数与表征方案。研究团队将在后续的迭代中力图解决这些挑战,并在更多场景开展模型训练和实验。

感兴趣的读者可以持续关注并可以通过开头的链接向团队提出反馈意见。

了解更多

猜你想看

← 返回首页