一出手就表现惊艳!国产开源大模型又杀出一匹黑马

栏目:互联网 | 来源:机器之心Pro | 2026-09-29 15:40

当 GPT-6 打出「抢着干活」的口号、Claude 把编程与终端操作牢牢按在自家腹地,开源阵营这半年也在同一条战线上加速集结 —— 从 Qwen 3.8、Kimi K3 到混元 Hy4,几乎每一次亮相都在把「代码 + 智能体」这条主线往前推一格。

一个共同的信号是:模型的价值锚点,正在从「答得漂亮」转向「干得成事」。

而在这大语言模型的红海中,一个新玩家正在悄然走入大家的视野。

我们观察到,就在昨天晚上,至知创新研究院开源了一个模型IQuest-Q1。模型采用稀疏 MoE 架构,总参数约 320B、激活参数仅约 15B,把训练重点放在代码、软件工程与复杂任务执行上,同时向推理、工具使用、长上下文理解与多步任务处理延伸。

在同代开源模型里,这是一个偏 "轻量" 的尺寸 —— 但从官方公布的评测和演示看,它给出的结果并不 “轻”。

模型权重与 Blog 已同步发布。

  • GitHub:https://github.com/IQuestLab/IQuest-Q1
  • Hugging Face:https://huggingface.co/IQuestLab/IQuest-Q1
  • Blog:https://iquestlab.github.io/

榜单表现:小激活参数,均衡打法演示之外,跑分是另一把尺子

在涵盖代码、软件工程、终端操作、工具使用和复杂智能体任务的多项标准评测中,IQuest-Q1 整体呈现出较为均衡的表现 —— 没有靠单项极高分撑起成绩,各类任务上的能力分布相对完整。

具体到单项:

  • 其中,IQuest-Q1 在仓库级代码生成NL2Repo以及网络安全基准CyberGym上得到了稳健的成绩;
  • 并且在终端Terminal-Bench 2.1、代码长程任务DeepSWE v1.1、办公场景JobBench等复杂任务评测中展现出均衡的能力。

考虑到 15B 的激活规模,这份成绩单在推理成本上也留出了不小的空间。

从写游戏到修 bug,模型开始 "接活"

IQuest-Q1 主打的是「可交付」—— 模型在任务过程中持续理解上下文、调用工具、处理反馈,最终交出一个可验证的结果,而不是一段停在编辑器里的代码。

我们拿到了官方放出的几组任务演示,覆盖前端交互、3D 场景、训练调试与真实工作环境,基本能勾勒出这款模型的能力边界。

在前端场景,用户一句自然语言指令下去,模型直接吐出一个可运行的交互应用。

以 FPS 游戏为例,IQuest-Q1 一次性搞定了三维场景、角色移动、射击与换弹、生命值、计分、Boss 战,甚至连资源和装备购买都做了出来 —— 代码生成、多文件组织、交互逻辑、视觉呈现,几件事同时在跑。

视频地址:https://mp.weixin.qq.com/s/Qr-GyQWBHlC7nhFKO19a9A

再看赛车游戏这一例。赛道延展、前景与背景的切换,这类场景通常对空间连续性要求很高。IQuest-Q1 处理起来比较从容,说明它在具备空间关系和连续交互需求的应用生成上已经比较扎实。

视频地址:https://mp.weixin.qq.com/s/Qr-GyQWBHlC7nhFKO19a9A

一次强化学习训练出现异常后,模型顺着训练曲线一路查下去 —— 读日志、看执行轨迹、分析可能原因、定位到具体代码,然后动手改。修复后重启训练,再用新的指标曲线验证结果。演示里模型给出的根因让人有些哭笑不得 ——"训练轨迹中被插入了一个空格"。改掉之后,指标重新爬升。

视频地址:https://mp.weixin.qq.com/s/Qr-GyQWBHlC7nhFKO19a9A

在另一个强化学习训练诊断案例中,系统发现 Reward 异常下降并非来自模型本身,而是由运行环境故障引起。定位问题后,系统修复环境与评分逻辑,恢复有效奖励信号,避免异常反馈继续影响训练。

视频地址:https://mp.weixin.qq.com/s/Qr-GyQWBHlC7nhFKO19a9A

在真实办公场景里,模型接入了聊天、在线文档、表格与评论等一系列上下文,综合信息后完成分析、生成文档、修订结果,最后交付一份可直接 “使用” 的方案。

技术拆解:320B 总参 / 15B 激活的 MoE 架构

IQuest-Q1 采用 decoder-only Transformer 主干 + 稀疏 MoE,总参数约 320B、激活参数约 15B—— 在当下动辄 "参数越大越强" 的开源节奏里,属于把宝押在了架构效率和后训练配方上的一路。训练分三段走:

  1. 预训练:奠定基础能力和世界知识;
  2. 中期训练:向复杂任务过渡;
  3. 后训练:围绕软件工程、长时程任务和通用推理做专项训练,配合监督微调与强化学习进一步收敛能力。

团队用了 Multi-Teacher On-Policy Distillation(MOPD),把不同教师模型在各类任务上的强项合并进单一模型 —— 这也是小激活模型追赶大模型的一条常见路径。

除了模型本身,团队还公开了这一版所使用的研发流程。

在研发过程中,模型参与能力诊断、训练方案设计和部分实验执行;人类研究人员则负责研究方向调整、高成本实验、版本采用等关键节点的审查与决策。

经过验证的模型更新、训练资产和研究流程会进入下一轮迭代直接复用,每轮沉淀下来的数据流程、训练配置、评估方法和工具也会持续沉淀下去。

从此次实践来看,我们观察到至知研究院这个模型赛道新玩家,在代码智能、复杂任务执行和模型自进化等方向上的探索,已经开始呈现出更清晰的技术脉络,这家机构下一步的动态值得持续关注。

了解更多

猜你想看

← 返回首页