告别「小道消息」与研发黑盒!上海AI实验室探索「全开放预训练」开源模式

栏目:互联网 | 来源:机器之心Pro | 2026-07-29 16:31

这一次,上海人工智能实验室(以下简称:上海 AI 实验室)不仅开源模型参数,更将大模型研发的「黑盒」打开。全量 Checkpoints、训练日志、内部架构采纳与取舍全过程实验全面公开。基模架构探索平台 ArchSpace 正式亮相,开启大模型开源全新阶段!当前,「下一个概念预测」模型(NCP)、深度注意力模型(Depth-Attention)等十余种架构创新提案正在开放验证。

告别「小道消息」:为什么我们需要一场开源范式革命?

过去几年,大模型架构快速演进,新方法层出不穷。但哪些尝试真正有效,哪些最终被放弃,又是基于什么作出取舍,外界往往无从得知。对于 LLM 架构创新的工作来说,如果说有比一个新想法更重要的,那可能会是公开、完整的验证过程,以及对成功和失败经验的如实记录。

在大语言模型(LLM)狂飙突进的今天,另一个不容忽视的现实是:最前沿的研发进展,正日益集中于掌握巨量计算资源的科技巨头手中。

科技巨头的研发节奏极快,而传统学术界从实验、论文撰写到投稿、审稿、发表的漫长周期,在以天为单位的产业迭代面前显得捉襟见肘。

由此出现了一个颇为尴尬的现象:AI 领域最前沿的技术细节与研发经验,越来越多地依靠私下交流、业内传闻乃至「小道消息」传播。无论学术界还是工业界,都缺乏一个公开、规范、记录可靠,并能让实验结果完整回溯的公共创新平台。

尤其在基础模型架构创新中,这一问题尤为突出。每一代开源基模发布,往往带来新的架构设计,但这些设计背后的探索过程 —— 哪些方案经过验证,哪些尝试最终失败,又为何做出取舍 —— 很少被完整公开。一项看似有效的创新,适用于多大规模的模型,经过完整训练流程后能否保持效果,带来的是实际收益还是额外成本,常常缺少公开、可验证的实验结果作为支撑。

大模型研发,不应是一个只展示结果、隐藏过程的「黑箱」。为此,上海 AI 实验室书生团队宣布将采用一种新的开发与开源模式:不仅开放最终的模型参数,也将逐步公开预训练过程中的实验记录、架构取舍和验证结果,推动大模型预训练从「结果开源」走向「过程开放」。

ArchSpace 架构创新开放验证可视化官网

  • 官方可视化网站:https://www.archspace.live
  • GitHub 代码仓库:https://github.com/InternLM/archspace(代码沿革与实验记录持续更新中)
  • Weights & Biases(W&B)日志记录平台:https://wandb.ai/archspace
  • Huggingface 模型权重集合平台:https://huggingface.co/ArchSpace-Collection

不仅开源最终参数,更开源研发生命线!

放眼国内外的大模型开源实践,所谓「开源」大多仍止于结果层面:发布最终模型权重,或提供一份技术报告,至于研发过程中的试错经验、架构权衡与失败实验,外界通常难以了解。

书生团队认为:真正的开放,不仅是共享「终点」,更是共享探索的每一个脚印。

在书生团队看来,开源不应只交付最终结果,也应尽可能公开结果产生的过程。上海 AI 实验室表示,此次将逐步开放大模型研发与训练的各个环节,具体包括:

  • 开源模型全量 Checkpoints 与完整训练记录:真实还原模型从零到一的成长轨迹;
  • 开源探索性小规模实验过程与结论:公开内部迭代中所有单点架构创新的尝试;
  • 开源架构选型与取舍逻辑:为什么选择这个方案?为什么放弃那个架构?让每一次研发决策的实验数据与依据都可被追溯;
  • 开源完整验证流程:社区提出的架构创新,将在统一流程下接受预训练、指令微调、强化学习的完整检验,而不只停留在局部实验或单一指标上。

ArchSpace 平台上线:直观可视化架构演进

为了将这种「全开放」模式落到实处,上海人工智能实验室将重点聚焦于基础模型架构(Foundation Model Architecture)的创新,涵盖但不限于:

  • 层间 Attention(Inter-layer Attention)
  • 隐空间模型(Latent Space Models)
  • 长上下文稀疏 Attention(Sparse Attention for Long Context)

同时,正式推出配套的开源可视化平台 ArchSpace。

在 ArchSpace 上,上海 AI 实验室将以一个经典的 Decoder-only Transformer 为起点,全面可视化从该起点出发的所有后续单点架构创新及迭代过程。

以一个新的 Attention 方案为例,用户可以在网站上清晰看到:

  • 实验室是如何一步步从小规模实验开始放大的;
  • 每一阶段的具体实验数据与对比结果;
  • 下一步验证的模型尺寸与关键指标;
  • 最终是否合并进入研发主线的决策原因。

每一个创新点,都有据可查;每一次成功或失败,都完全可回溯。

ArchSpace 架构提案与实现流程:从社区提交 issue、审阅与投票,到分支实现、阶段性实验和合并。

具体而言,社区若关心近期架构创新论文提出的「下一个概念预测」(Next Concept Prediction,NCP)等方向的真实效果,可在 ArchSpace 的 GitHub 仓库提交相应的 架构创新提案(architecture proposal issue)。

提案经委员会审阅通过后,ArchSpace 将分阶段推进 scaling 与验证工作,依次在 1B、3B 和 8B 等主流模型尺寸上进行效果评估。目前最大规模的验证将对齐全开源基模 Olmo 3 的完整训练流程:覆盖预训练、长上下文继续训练和指令遵循微调,训练规模合计约 6.2T tokens。模型训练、评测日志将在 Weights & Biases(W&B)平台记录并公开,最终将架构创新的知识、经验透明开放给行业共享。

委员会由学术界与工业界的专家联合组成,目前仍在持续建设,现有成员包括上海交通大学林洲汉副教授、复旦大学张奇教授、复旦大学纪焘助理教授、上海 AI 实验室青年研究员团队等。

评委会将以同行评议方式,对社区提交的架构创新提案进行审阅,重点从创新价值、技术可行性与实验设计完备性三大纬度,遴选出具备验证价值的提案进入 ArchSpace 正式验证流程。对于通过评议的提案,实验室提供双聘、实习生等多样化合作机会。

ArchSpace 架构验证流程:与 Olmo 3 训练流程对齐,覆盖 1B、3B、8B 模型规模。

ArchSpace 训练、评测日志可视化

目前,ArchSpace 已汇聚 Next Concept Prediction [1]、Depth-Attention [2]、SiameseNorm [3]、Artificial Hippocampus Networks [4]、MorphNorm [5] 、Mobius [6] 等十余项架构创新提案。这些提案正在等待「跑完全程」,接受同一套公开、完整的训练与评测验证。

据上海 AI 实验室介绍,ArchSpace 委员会当前仍保持开放,并邀请学术界和产业界更多专家加入,共同发现并推动真正值得验证的架构创新。

上述架构创新相关的论文或提案:

  • [1] Liu, Yuliang, et al. "Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models." arXiv preprint arXiv:2602.08984 (2026).
  • [2] Zeng, Boyi, et al. "Depth-Attention: Cross-Layer Value Mixing for Language Models." arXiv preprint arXiv:2606.05014 (2026).
  • [3] Li, Tianyu, et al. "Siamesenorm: Breaking the barrier to reconciling pre/post-norm." arXiv preprint arXiv:2602.08064 (2026).
  • [4] Fang, Yunhao, et al. "Artificial hippocampus networks for efficient long-context modeling." arXiv preprint arXiv:2510.07318 (2025).
  • [5] https://github.com/InternLM/archspace/issues/5
  • [6] https://github.com/InternLM/archspace/issues/9

资源有限,但探索无限:大模型时代科研组织的新范式

依托现有算力条件,上海 AI 实验室将率先在 1B/3B/8B 参数量级上,对这一全新的开发与开源模式进行实证与落地。

尽管当前规模尚属轻量级,但这标志着实验室正积极探索并构建一种适配大模型时代的全新科研组织范式:

  • 让大模型训练的技术细节从「黑箱」走向「完全开放」;
  • 让具体创新点的效果评估从「小道消息」走向「公开可引用、可回溯」;
  • 让每一次成功与失败的实验,都成为社区下一次创新可复用的知识资产。

这不仅是上海 AI 实验室书生团队在基模架构创新上的一次深度试炼,更是献给全球 AI 科研社区的一份礼物,期待共同见证开源大模型的全新阶段。

了解更多

猜你想看

← 返回首页