出品 | 网易智能
作者 | 辰辰
编辑 | 王凤枝
9月才过三天,大模型已扎堆上新。
美国时间9月2日,推出Gemini 3.8 Flash和网络安全版本3.8 Flash Cyber;数小时后,Meta又发布Muse Spark 1.3。而就在9月1日,Anthropic发布Claude Fable 5.1。此外OpenAI已经预告Astra即将推出;马斯克也称,xAI计划在约10天后发布Grok 4.7。


从跑分看,Gemini 3.8 Flash和Muse Spark 1.3的成绩都已接近Claude Fable 5.1。价格却不在一个量级:前两款模型每百万输出Token分别为3.75美元和4.25美元,Claude Fable 5.1则是50美元。
这不等于谷歌和Meta已经全面追平Claude。跑分相近,实际使用体验、最高能力和产品成熟度仍可能相差很远。但至少在榜单上,过去只有高价前沿模型才能达到的成绩,正被一批价格不到其十分之一的模型逼近。
两家公司通向低成本的路线,并不相同。
谷歌让Gemini 3.8 Flash在复杂任务上"更努力",用更多推理、工具调用和Token换取更好的结果。Meta则称,Muse Spark 1.3比上一代少用约25%的Token,以更低的计算消耗完成工作。
跑分相差无几,模型战争已经打到了榜单之外。
一、六周三更,谷歌让模型"更努力"
谷歌最先让人注意的是更新速度。从3.6、3.7到3.8,Flash系列在六周内更新了三次。3.8距离上一版发布只有三周。
谷歌称,3.8 Flash是公司目前最强的推理与编程模型,在软件工程、智能体任务和专业领域的多步推理上,都比3.7 Flash有明显提升。
在长程软件工程基准DeepSWE v1.1中,谷歌称3.8 Flash超过了多数规模更大的前沿模型。在Vals Finance Agent V2和Harvey Legal Agent Benchmark两个专业领域测试中,它也超过了3.7 Flash和部分前沿模型;HLE-Verified成绩则达到54.9%。

六周三更,并不意味着谷歌在六周内从头训练了三代基础模型。谷歌明确披露的是,3.8使用长时间运行的智能体循环,反复评估和改进模型;至于预训练底座是否更换,官方没有说明。可以确认的变化,是模型发布和后训练迭代正在变得更密集。
但3.8 Flash提高成绩的方法,谷歌没有藏着。
官方给出的关键词是"更努力"。遇到复杂任务时,模型会增加推理步骤,反复调用工具;到了更高的努力档,它还可能使用更多Token来换取性能。
二、单价没涨,任务总账可能更高
Gemini 3.8 Flash当前的优惠价与3.7相同:每百万输入Token 0.75美元,输出Token 3.75美元。这个价格持续到2026年12月31日;从2027年1月1日起,标准价格将调整为输入1.5美元、输出7.5美元。
单价没变,模型每次工作使用的Token却可能增加。
Artificial Analysis在高努力档测试中发现,3.8 Flash完成一项智能指数任务的平均成本为0.58美元,比3.7 Flash的0.40美元高约40%。原因是平均输出Token增加了30%,智能体评测中的执行轮次也变多了。

这个40%只是高努力档测试的结果,其他档位不同。在同一组测试中,3.8 Flash的中努力档单任务成本为0.41美元,低努力档为0.24美元。谷歌也建议更看重计算效率的开发者降低努力档,或者继续使用3.7 Flash。
谷歌没有提高每Token单价,而是给了高努力档更多计算空间。在这类任务里,按量付费的用户可能看到总账增加;使用套餐或免费额度的人,也可能发现同一份额度能够完成的任务变少了。
三、更强的网络安全能力,普通用户拿不到
同一天,谷歌还发布了3.8 Flash Cyber,一个专门面向网络安全的版本。
谷歌称,它在CyberGym漏洞发现基准上超过3.5 Flash Cyber和一些规模更大的前沿模型;在公司内部一项覆盖20种编程语言的测试中,漏洞发现成功率超过70%。
补丁能力也被单独拿出来展示。在Collinear运营的CWE-Bench上,3.8 Flash Cyber的pass@1为47.2%,接近领先模型的47.8%。Chrome安全团队称,它为Chrome漏洞生成的正确补丁数量,是更大商业模型的2.6倍。安全公司Wiz则称,在自己的内部渗透测试基准中,它的召回率高出7.5至9.7个百分点,成本低2.3至5.2倍。
谷歌自己的云漏洞研究团队还用它在不到两小时内发现了一个关键的基础性漏洞。按照谷歌的说法,这类漏洞通常需要研究数月。从公开说明看,还无法判断人类研究人员为这次任务划定了多大范围、提供了多少线索,因此它更适合作为能力案例,而不是普遍效率的证明。

这些能力并未直接向普通开发者开放。
3.8 Flash Cyber目前只通过Fairwind Program提供给政府机构、关键基础设施运营方、软件维护者等"可信防御者"。谷歌称,该项目在全球已有超过650家参与伙伴,包括CrowdStrike和美国互联网安全中心等机构。
谷歌给出的理由是,Cyber版本采用了更宽松的网络安全防滥用限制,能够执行更完整的漏洞发现和修复工作,因此需要更严格的准入和运行管理。能力更强的Cyber版本,反而只对更小范围的机构开放。
四、Meta把价格压到Claude的十分之一左右
Meta这边,Muse Spark 1.3最醒目的地方仍然是价格。
它的标准价格与上一代相同:每百万输入Token 1.25美元,输出Token 4.25美元。Claude Fable 5.1的对应价格是10美元和50美元,分别是它的8倍和近12倍。
Artificial Analysis的测试显示,Muse Spark 1.3当前可用的xhigh档拿到61分;尚未普遍开放的max档为62分,与Claude Fable 5.1的高努力档相同。不过,Claude Fable 5.1在max档拿到66分,仍然领先。

这些数字说明Muse已经进入Claude所在的分数区间,但不能据此认定Meta已经追平Claude的最高能力。不同努力档的计算预算并不相同,榜单也无法完整呈现编程产品、工具生态和长期任务中的实际体验。
扎克伯格在社交平台上写道:"前沿性能,便宜到几乎不计费。这是我们迄今在编程和智能体工作上最大的一次提升。"

Meta首席AI官汪滔(Alexandr Wang)则将这次定价形容为"激进"。除了价格,公司还强调模型完成任务时花得更少。按照Meta工程师的比较,Muse Spark 1.3比1.2少调用约20%的工具,少使用约25%的Token。
它还被训练得更愿意和用户配合:指令不清楚时主动追问,遇到障碍时请求帮助,执行不可逆操作前先确认;在一条长对话中,也能同时维持多项工作,不必为每个任务重新开一个窗口。
五、标准低价之外,还有一种数据交换
Muse Spark 1.3的标准价格已经很低。除此之外,Meta还提供了一个更便宜的Contributor选项。
汪滔向Axios介绍,如果开发者允许Meta使用其工作来改进模型,编程产品的使用成本还可以进一步降低。他称,目前选择这一方案的开发者比例已经达到"两位数"。
这是一项可选交换,不是Muse Spark 1.3标准低价的前提。开发者可以继续使用普通付费版本,不授权Meta将这部分工作用于改进模型;愿意选择Contributor方案的人,则允许Meta使用相关工作内容来改进模型,换取更低价格。
Meta为什么愿意把标准价格定得如此激进,并没有唯一答案。公司正在投入巨额资金追赶OpenAI、Anthropic和谷歌,低价既能吸引开发者试用,也能让模型进入更多编程和智能体工作流。
接下来,Meta还准备推出代号Watermelon的更大模型。汪滔称它会"非常有竞争力",但没有给出发布时间。开放权重计划也需要区分:Meta表示还会发布Muse Spark的开放权重版本,但1.3是否开放尚未决定;上一代1.2仍在计划之中。
Meta眼下最能打的一张牌就是价格,能不能把低价换成稳定使用量,要看它进入真实工作之后的表现。
六、跑分追近了,体验还没有定论
两场发布很快把一个老问题重新推了出来:排行榜上的提高,能不能直接换成用户能够感受到的进步?
BridgeMind在X上把这种现象称为"benchmaxing",也就是围着基准刷分。它写道,Gemini 3.8 Flash和Muse Spark 1.3的成绩都很好,但近来的模型发布总在重复同一种情况:"分数跳了,真实世界的体验没有。"

针对Gemini 3.8 Flash,Abacus首席执行官宾杜·莱迪(Bindu Reddy)给出了更明确的反面结果。她称,3.8在Abacus自己的测试中不如3.7,在隐藏问题和数据分析任务上都出现退步,因此怀疑它对公开基准存在过度拟合。

开发者Antikythera的个人测试更复杂。他认为3.8 Flash速度快、处理高难度编程问题不错,也不容易偷懒;但在设计、用户体验和部分智能体编程任务上表现一般,也并非所有任务都省Token。他进一步判断,问题可能来自较旧的预训练底座,不过谷歌没有公开足够信息验证这一推测。

这些具体的负面体验主要针对Gemini 3.8 Flash。Muse Spark 1.3刚刚上线,公开的独立使用反馈还很少。
几条个人测试不足以推翻谷歌和Artificial Analysis的整套结果,但它们提醒了另一件事:排行榜只能说明模型在固定条件下能跑到哪里,无法回答它进入自己的代码库和工作流以后,究竟省不省钱、省不省事。
谷歌的优惠价格将在年底到期;Meta尚未开放Muse Spark 1.3的max档,也没有决定是否开放这一版的权重。
榜单已经追近,谁能更便宜地把活干好,才是用户真正关心的。