
最近一周,硅谷AI圈的两件大事将AI的路线之争推至顶点。
先是黄仁勋首条X推文转发25家巨头联署公开信,呼吁审慎监管开源AI模型;紧接着,OpenAI与Anthropic罕见联手,超1100名员工联署呼吁“控速”,Meta创始人兼CEO扎克伯格则公开反击称这是扼杀创新。
硅谷还在吵“该不该开源”“该不该踩刹车”的时候,大洋彼岸的中国AI圈,开源和前进似乎从来就不是一道选择题。从DeepSeek到智谱,从通义到蚂蚁百灵,中国大模型的开源步伐从未停歇。
7月24日——恰恰是黄仁勋发推支持开源的同一天,蚂蚁百灵正式发布了新一代原生混合推理模型Ling-3.0-flash。该模型在OpenRouter与百灵官方平台同步开放限时免费API调用,免费期截至8月3日23:00,模型权重将在免费期结束后正式开源。
在Token调用量排行中,Ling-3.0-flash自发布其5天内从第9位跃升至第6位,7月29日的调用量仅比DeepSeek V4 Pro低0.5%。

Ling-3.0-flash总参数量为124B,激活参数量仅为5.1B,与其5月开源的旗舰级思考模型Ring-2.6-1T相比,总参数量约为后者的12.4%,激活参数量仅为后者的8.1%,却在12项基准测试中有11项表现优于Ring-2.6-1T。

硅谷巨头们争论不休的问题“开源能不能既安全又强大?”蚂蚁百灵用产品给出了自己的回答。
一、以小搏大,12项测试11项超越万亿旗舰
先来看看Ling-3.0-flash的成绩:
在基准测试上,Ling-3.0-flash在34个评测维度中拿下15个第一、19个第二,综合均分与DeepSeek-V4-Flash并列第一,领先万亿级旗舰Ring-2.6-1T(59.7分)近8分。
蚂蚁百灵同步提出了两项新指标:智能密度(均分/总参数量)与智效比(均分/激活参数量)。Ling-3.0-flash智能密度达0.5,智效比高达13.2,在可比模型中双双登顶,几乎是用最少的参数撬动了最高的性能。
在代码能力方面,在SWE-Bench Pro测试中,模型需要理解代码库、定位问题并生成可通过测试的补丁,Ling-3.0-flash以56.6%的得分位居参测模型第一;在一次性生成完整交互式组件的ArtifactsBench中,其77.0%的得分断层领先,高出第二名10余分。
MiniAppBench要求模型根据一句话需求生成完整APP,在16个主流模型平均仅17%通过率的硬核测试中,Ling-3.0-flash达到25.3%,与总参数约两倍的开源SOTA模型处于同等水平。
通用Agent能力方面,BFCL-v4是行业通用的函数调用评测,Ling-3.0-flash以73.0%的准确率与Claude-Sonnet-4.6并列第一。在端到端综合Agent评测GDPVal v2-AA中,Ling-3.0-flash以1107分的成绩在参测模型中拔得头筹。Tau3-banking-AA将模型置于模拟银行系统中完成金融操作,其28.0%的得分仅次于Claude-Sonnet-4.6。

搜索Agent能力上,WideSearch测试中,模型需在海量网页中快速定位与用户问题最相关的信息,Ling-3.0-flash以73.6%排名第三。在多智能体协作模式下,该模型在BrowseComp测试中达到82.0%,与Claude-Sonnet-4.6的82.1%基本持平,验证了其在复杂网页交互中的信息获取能力。
指令遵循能力决定了模型在严格约束下的执行可靠性,IFBench检验模型对格式、角色、语气等多重约束指令的遵循程度,Ling-3.0-flash得分74.5%,排名第三。LIFEBench则测试多轮对话中的长期指令记忆与遵循能力,Ling-3.0-flash以77.3%位列第一,验证了其在长程交互中的稳定性。
推理能力上,在高难度数学竞赛测试中,Ling-3.0-flash的表现基本与主流模型持平;在专家级跨学科知识推理测试HLE中,Ling-3.0-flash依然领先万亿级旗舰Ring-2.6-1T。
长上下文能力是Ling-3.0-flash原生支持256K上下文窗口的直接体现。在MRCR_256K测试中,模型需在多轮对话中定位长文本关键信息,Ling-3.0-flash取得81.1%,在同等规模模型中表现优异。Multi-IF测试多轮对话中持续遵循跨轮指令的能力,Ling-3.0-flash以87.7%位列第二。

二、能力实测:快、稳、省,三个字能不能站住脚?
基准测试终究是“考试”,模型好不好用,得看它能不能在实际场景中帮人把事办成。
与其他模型不同,Ling-3.0-flash的定位非常清晰:不是要取代超大参数规模的通用推理模型,而是做那个可以帮你做事的AI。
在视觉与互动场景中,Ling-3.0-flash的核心能力集中在两点:一是极短的首字响应时间,二是多轮对话中维持复杂空间逻辑的能力。
例如在游戏开发场景中,Ling-3.0-flash适合以“结对编程”模式参与渐进式开发。模型在多轮对话中能够维持工程架构的一致性——不丢上下文、不跑偏架构、不陷入死循环。
通过三轮对话,我们用Ling-3.0-flash做出了一个3D台球模拟器。可以看到,在这个模拟器中,我们可以控制白球的击球角度和力度,彩色球被撞击后的路径也基本符合物理规律。在生成过程中,Ling-3.0-flash的反应速度很快,几乎不需要思考,可以精准找到BUG,并进行迭代优化。
在开发者与办公场景中,Ling-3.0-flash展现的是长程任务的稳定性、多系统协同的调度能力,以及在严格约束下保持输出质量和格式一致性的执行力。
在多智能体协同场景中,Ling-3.0-flash支撑了一套完整的科研工作流。不同Agent角色各司其职:Scientist提出假说、Data Analyst检索与验证、CrossValidator交叉质询、Archivist归档沉淀、Writer自动产出论文与Slide报告。
在办公自动化场景中,Ling-3.0-flash通过挂载Office MCP工具集,将自然语言指令转换为序列化的API调用,实现跨应用自动化工作流。
例如,用户下达单次指令后,Ling-3.0-flash自动在Excel中填入数据并生成透视表,随后提取核心图表插入Word文档并完成排版。整个过程中,模型不依赖易出错的GUI模拟操作,而是通过底层协议直接驱动软件,而这正是“稳定工具调用”能力的落地体现。
此外,Ling-3.0-flash无需外部图像素材,仅凭代码便可批量生成视觉表现力突出的艺术网页。
该模型可以批量产出多款契合不同现代设计流派的页面,覆盖包豪斯、波西米亚、酸性设计等风格,难度梯度由易至难。页面完全依托CSS渐变、SVG路径与版式布局构建,脱离外部图片素材依旧还原了各类设计流派独有的美学特征。
三、混合线性注意力+1/64稀疏MoE,把每一分算力榨干
“小身材大能量”的背后,是模型架构上的创新。Ling-3.0-flash放弃了单纯堆砌参数的思路,从预训练阶段即对计算架构进行了重新设计。
Ling-3.0-flash从预训练伊始即采用原生混合线性注意力架构,以5:1的比例交替堆叠KDA(Kimi Delta Attention)线性注意力层与MLA(Multi-head Latent Attention)层。
其中,KDA将上一代的Lightning Attention进行了升级,在Delta Rule的状态更新中引入细粒度对角门控,赋予不同特征通道独立的保留、衰减与写入控制能力。这让模型在处理长文档和大型代码库时,能更精准地记住跨段落的关键信息,避免在长上下文中“迷失”。
MLA则通过低秩压缩将KV Cache大幅缩减,降低推理时的显存占用。两者以5:1的比例交替堆叠,让模型在长上下文效率、状态记忆与计算成本之间实现了协同跃升。

百灵团队提出的“Ling Scaling Law”认为:更低的专家激活比例带来更高的“效率杠杆”。Ling-3.0-flash进一步压缩了单次计算的专家激活比例,将每个Token的专家激活比例由前代的1/32压缩至1/64。
1/64的稀疏比例意味着,模型虽然总参数达124B,但每次推理只需激活5.1B参数参与计算。通过更精细的专家路由策略,让每个Token只调动最相关的少数专家,将算力精准投放到当前任务最需要的地方。
此外,为了让AI Agent运行更快、更稳,百灵为Ling-3.0-flash匹配了集群级的分级缓存架构。模型创新接入了SGLang HiCache与Mooncake分级缓存体系(物理双池、集群共享L3),使长程交互无需重复计算。
该缓存架构借鉴了现代CPU的三级缓存设计理念,将GPU内存、主机内存与分布式存储分别组织为L1、L2、L3三级缓存。长对话和多轮交互中,已计算过的KV Cache可以被复用,避免重复计算。实测数据显示,长输入场景下的首字响应时间(TTFT)降低60%至80%以上。

在任务稳定性上,百灵还升级了多智能体协同架构——Ling Multi-Agent。各Agent通过分工协作、相互校验,有效减少了单一模型在长程任务中容易“跑偏”或误判的风险。
这套架构让Ling-3.0-flash从一个单点执行器,升级为可支撑多角色协同的“集团军”作战平台,为高频线上服务与真实业务落地提供了支撑。

从混合线性注意力到多智能体协同,四层架构环环相扣。正是这套从底层计算到上层调度的系统性重构,让Ling-3.0-flash以124B总参、5.1B激活的体量,在12项测试中11项超越万亿旗舰成为可能。
结语:开源、能干活,才是最大范围实现技术普惠
5 月开源万亿级Ling-2.6-1T、Ring-2.6-1T、Ling-2.6-flash,7月推出Ling-3.0-flash并计划8月3日开源,蚂蚁百灵开源节奏持续提速。
相比单纯新增模型,Ling-3.0-flash更大的价值,是将轻量化高性价比的技术路线推向新阶段。在高并发、低延迟的Agent商用场景下,依托约1/12激活算力即可逼近旗舰模型表现,有效降低企业推理开销。
当开源模型兼顾实用性、效果与成本优势,技术普惠才有落地的现实基础。