市值暴涨1300亿!阿里最强千问大模型登场,2.4万亿参数,自主连续编程16天破纪录

栏目:互联网 | 来源:智东西 | 2026-08-03 22:41
智东西作者 江宇编辑 云鹏

智东西8月3日报道,今天,阿里正式发布旗舰大模型Qwen3.8-Max,总参数量达到2.4万亿,激活参数为950亿。这是目前参数规模最大的千问模型,也是千问首个计划开放权重的Max级模型

阿里巴巴港股股价应声上涨7.26%,市值达2.41万亿港元。

▲图源:腾讯微证券(截至8月3日13点)

Qwen3.8-Max此次升级主要集中在编程、办公、科研、长程任务和多模态智能体五个方向。相比上一代Qwen3.7-Max,新模型更强调端到端完成复杂任务。

API价格方面,Qwen3.8-Max国内每百万Tokens输入12元、输出36元,隐式缓存命中1.5元;海外每百万Tokens输入2美元、输出6美元,隐式缓存命中0.25美元。

▲API价格对比表(智东西制图)

发布当天,Qwen3.8-Max也出现在国际权威评测榜单Arena三个分项的前列。

  • 在文本任务Text Arena中,Qwen3.8-Max以1496分位列实验室榜第二,单模型排名第五,仅次于Anthropic;

  • 在CodeArena WebDev榜单中,其以1668分位列实验室榜第三、单模型第四,排在Claude Opus 5 Max和Kimi K3 Max之后;

  • 在Vision Arena中,Qwen3.8-Max以1305分位列第二,仅落后于Claude Fable 5,并略高于Claude Opus 4.7 Thinking。

与此同时,在多项基准测试中,Qwen3.8-Max的表现已经逼近Claude Fable 5、GPT-5.6 Sol和Gemini 3.1 Pro的最新旗舰模型。

例如,在论文复现基准PaperBench中,Qwen3.8-Max取得93.0分,高于GPT-5.6 Sol、Fable 5和Claude Opus 4.8。在评估电脑操作能力的OSWorld-Verified中,Qwen3.8-Max以86.1分位居参评模型首位;在参数化CAD基准中,其91.5分同样超过Fable 5、GPT-5.6 Sol和Gemini 3.1 Pro。

不过,Qwen3.8-Max尚未在所有测试中取得领先。

在TerminalBench 2.1中,其成绩为86.6分,略低于GPT-5.6 Sol的88.8分;在SWE-bench Pro中,Qwen3.8-Max获得67.7分,落后于Fable 5的80.0分和Claude Opus 4.8的69.2分;在长视频基准VideoMME v2中,其68.3分也低于GPT-5.6 Sol的71.1分。

半个月前,Qwen3.8-Max预览版已经率先上线Qoder和阿里Token Plan。当时千问团队称,这款模型“可能是除了Fable 5外最强大的模型”。

如今正式版交卷,其重点落在:模型能否脱离人工持续陪伴,自己把一个跨度数小时、数天甚至数周的任务做完。

为了检验这一点,千问团队让Qwen3.8-Max连续自主编程约16天独立复现并改进一篇研究论文参加真实算法竞赛,还让它在超过2000轮交互中经营一家虚拟电商企业

智东西也使用Qwen3.8-Max进行了一次3D世界生成实测:将《奥德赛》开篇交给模型,要求其用Three.js转化为一个可交互的古希腊世界。一次生成的版本已经搭建出基本场景和交互框架,但整体较为简陋。

目前,Qwen3.8-Max已经上线千问AI平台,模型权重将在下周登陆Hugging Face和ModelScope,开发者可以下载模型参数自行部署。

技术Blog:https://qwen.ai/blog?id=qwen3.8
API:https://www.qianwenai.com/models/qwen3.8-max
Qwen Studio体验:https://chat.qwen.ai/?models=qwen3.8-max

一、实测:生成《奥德赛》3D世界

为了观察Qwen3.8-Max在长代码、3D场景生成和视觉反馈方面的表现,智东西让它将《奥德赛》开篇转化为一个可交互的Three.js项目。Qwen3.8-Max的一次生成版本已经可以运行,并搭建出了海岛、神殿、人物和基础镜头运动。

不过,初版的视觉效果相对简陋。建筑和人物主要由基础几何体组成,场景之间的联系较弱,部分物体更接近符号化摆放,离“可探索的古希腊世界”仍有距离。

我们随后将这些问题反馈给模型,要求其继续丰富场景密度、调整材质和光影,并补充环境动画。

第二个版本在植被、建筑结构、海面、天空和空间层次上有所改善,画面完成度高于一次生成结果,但视觉效果仍相对简陋。

不过,与Andrej Karpathy使用Claude Opus 5生成的《指环王》3D世界相比,Qwen3.8-Max在场景编排、模型细节和整体沉浸感上仍有差距。


二、连续自主编程16天,构建自进化Harness

长程编程是Qwen3.8-Max此次升级的重点。

在千问团队展示的一个案例中,Qwen3.8-Max被要求从零创建一个名为oh-my-cli的项目,并为其搭建能够持续自我更新的Agent开发系统。模型需要处理来自用户、开发者社区和自身测试结果的多种反馈,将新需求整理成GitHub Issue,再自动领取任务、修改代码、运行测试、提交PR和处理异常。

这套系统包含一套完整的任务状态机。新Issue进入后,会依次经历ready、leased、active等状态;代码完成后,模型自动触发构建、单元测试、端到端测试和桌面端生命周期验证,检查未通过的任务则被重新打回修改。

截至7月30日,这个项目已经在无人持续介入的情况下运行约16天,累计留下265次代码提交、127个PR和151个Issue。

相比一次性输出数千行代码,这类案例考察的是模型能否管理一个持续变化的工程项目,包括保留任务状态、吸收新反馈、恢复中断任务以及判断什么时候可以合并代码。

Qwen3.8-Max还被要求从零复现论文《Unified Data Selection for LLM Reasoning》

在没有初始代码和现成实验流水线的情况下,模型连续工作约125小时(约五天),编写约7600行代码,执行超过1100步操作,完成33轮GPU训练。

前37个小时里,它搭建了数据处理、模型训练和评测程序,复现了论文中的六项主要结论。其中,论文提出的数据选择方法在AIME 2024上的成绩比随机选择数据高7.7个百分点。

随后,模型继续运行约88小时,围绕实验结果提出18种改进方案,经历四轮假设、实验和分析,最终找到一种新的数据选择方法,在AIME 2024上又提高2.7分。

在另一个真实竞赛案例中,Qwen3.8-Max参加了阿里云天池平台上的WWW 2025多模态对话意图识别挑战赛,与526支人类队伍竞争

模型需要同时处理电商客服对话中的文字和商品截图。它在24小时内自行搭建文本模型、视觉模型和加权投票系统,并根据每次提交的排名反馈继续调整方案。

经过45次提交,其准确率由0.60提升至0.853,最终击败458支人类队伍,超过参赛队伍总数的87%。

三、调度约330个子Agent,一次对话跑完6000次回测

在通用办公和专业任务方面,Qwen3.8-Max开始承担更完整的工作流。

千问团队称,他们扩展了用于强化学习的真实任务环境,覆盖QwenWork、Claude Code、Codex、OpenClaw和Hermes等多种Agent框架。

随着RL训练持续scale up,Qwen3.8-Max在数十个in-house / public工作基准上取得的性能提升。

这些训练环境不再只包含单文件、单步骤任务,还加入多文件目录、复杂工作区、跨天执行以及不同版本的工具和Skill。

Qwen3.8-Max在QwenWork、Claude Code、Codex、OpenClaw、Hermes等众多 harness 取得的性能表现。

为了让模型在大量任务中获得相对统一的反馈,千问搭建了一套通用奖励系统,同时检查程序执行结果、文本质量、视觉渲染效果和Agent操作过程。

在职业任务案例中,Qwen3.8-Max被用于法律、设计、餐饮、建筑、医疗和体育分析等场景。

面对数百份企业合规文件,模型在一小时内标记出1284条相关条款;在UI设计任务中,它生成了包含8个页面的可交互数字银行App原型;在餐饮任务中,模型结合上百份食材供应资料,生成26道菜的完整菜单,并将食材成本率控制在33.8%。

在结构工程任务中,模型依据一份图纸,在浏览器中还原出30层写字楼的抗震结构模型;在体育分析任务中,它处理了每名球员约8400个攻防回合,并生成球员画像与教练报告。

Qwen3.8-Max还展示了大规模子Agent调度能力。

在量化研究案例中,模型仅根据六条因子描述,将动量、价值、质量、投资、低风险和情绪六类因子分别拆解为50个研究方向。整个过程中,Qwen3.8-Max调度约330个子Agent,完成约6000次回测,并根据阶段性结果调整后续搜索方向。最终入选因子的超额夏普比率介于0.64至1.48之间,日频Rank IC介于0.010至0.014之间。

在另一项ETF轮动策略任务中,模型从一句任务描述出发,自行搭建数据系统、设计因子、运行回测并处理过拟合问题。

当它发现设计期指标上升、验证期指标下降时,会主动删除冗余因子;当多个搜索方向集中到同一组信号时,又会加入不同随机种子进行验证。

四、500轮迭代重写芯片设计,门数由8298个压至678个

除了软件工程,Qwen3.8-Max还被用于数字芯片设计

测试任务要求模型设计一款集成模幂和模乘运算的GCD/RSA硬件加速器,在保证4、6、8、16位配置全部通过功能验证的前提下,尽可能减少综合后的逻辑门数量。模型获得的初始材料只有任务说明、一个不包含内部逻辑的RTL接口骨架和评估脚本。

随后,Qwen3.8-Max在包含Iverilog、Yosys和OpenROAD的沙箱环境中,自行完成算法设计、代码编写、仿真、综合和物理布局。

在一次连续运行中,模型经历约500轮交互和71次正式评估。

第一个通过功能验证的版本需要8298个门。经过算法重写、位宽缩减、状态机剪枝、模块融合和逻辑复用后,最终版本只剩678个门。

其中,幅度最大的一次优化发生在第22轮交互。模型将成本较高的16位硬件取模除法器替换为迭代移位减法架构,门数一次减少6288个,由8298个降至2010个。

在物理实现环节,初始版本的芯片面积为106×106微米,布线总长度为33369微米,时序余量为-4.46纳秒。最终版本面积缩小至46×46微米,布线长度降至4187微米,并在500MHz下实现时序闭合,时序余量达到0.66纳秒。整体面积缩减81%。

模型在数百轮交互后仍能继续进行算法和结构层面的修改,而不是仅修补语法错误,体现出其维持长期工程状态的能力。

另一项长周期测试来自E-Commerce Bench。

这是一个模拟365天电商经营的基准,包含12种店铺类型、60个商品类目、近600家供应商和约7000种商品。模型获得10万元启动资金,需要自己完成选品、采购议价、库存、定价和退货处理。

其中,近600家供应商中隐藏着152家欺诈商家,模型还会遭遇大促、台风和供应链中断等随机事件。在超过2000轮交互后,Qwen3.8-Max最终获得416252元现金,相当于初始资金的4.16倍。其成绩比第二名GLM 5.2高38%,相比Qwen3.7-Max提高152%。

五、能看百小时视频,也能操作电脑复刻应用

Qwen3.8-Max此次也强化了多模态能力

它可以处理超过200页的财报和复杂PDF,跨页面提取文字、图表和版面信息,并将结果整理为结构化报告或网页。

针对长视频,模型可以处理超过100小时的素材,并围绕人物、事件、时间和场景构建视频记忆,用于追踪人物关系和事件变化。

在输出端,模型能够根据截图编写前端项目,将户型图转化为Blender 3D装修效果,或把素材剪辑成Vlog和教学动画。

多模态效果

更关键的是,模型可以观察自己生成的页面、3D场景和动画,根据视觉结果继续修改代码。这种编程与图形界面操作结合的方式被称为“Hybrid Agent”。

为测试该能力,千问团队搭建了RecreationBench。模型只能观察一个正在运行的真实应用,无法读取源代码,也不能联网,需要通过点击、输入和观察反馈,复刻Ubuntu、macOS、Windows、Android及Web平台上的应用。

Qwen3.8-Max在这一内部基准中取得51.7分,低于Fable 5的56.1分,高于Claude Opus 4.8的48.0分、GPT-5.6 Sol的47.6分和Gemini 3.1 Pro的16.2分。

在更成熟的公开电脑操作基准OSWorld-Verified中,Qwen3.8-Max获得86.1分,超过Fable 5的85.0分、Claude Opus 4.8的83.4分和GPT-5.6 Sol的83.2分。在MobileWorld中,Qwen3.8-Max取得77.8分,略高于GPT-5.6 Sol的76.9分,但低于Fable 5的85.5分。

为了让现有Agent框架获得多模态能力,千问还推出了Qwen-MM-Plugins。该扩展库可为不同Agent框架补充图像和视频处理、多模态记忆、动态分辨率、视觉工具调用,以及视频剪辑、Blender和CAD等专业工具支持。

结语:旗舰开源竞争转向长程交付

Qwen3.8-Max的升级方向相当明确:参数规模继续扩大,模型能力则更多围绕复杂任务的实际交付展开。

连续运行16天维护代码仓库、用125小时复现并改进论文、调度约330个子Agent完成6000次回测、在500轮交互中优化芯片设计,这些案例都反映出:模型正在尝试能否在较少人工干预的情况下,持续处理反馈并完成开放任务。

从测试结果来看,Qwen3.8-Max已经在论文复现、电脑操作、CAD、文档理解和部分多模态任务中达到前沿水平;在SWE-bench Pro、TerminalBench 2.1和部分长视频测试中,它与最新闭源模型仍有差距。

下周开放权重后,开发者将能进一步检验其真实能力,包括2.4万亿参数模型的部署成本、Agent长时间运行的稳定性,以及内部案例能否在外部环境中复现。

了解更多

猜你想看

← 返回首页