刚刚,MiniMax剧透新一轮「斩杀线」!8亿美元ARR炸场

栏目:互联网 | 来源:新智元 | 2026-08-27 22:59

新智元报道

昨天,大模型圈热闹了一整天。

下午,智谱上线并开源GLM-5.3-Flash,定价是Opus 4.8的四十分之一。

晚上,阿里接上Qwen3.8-Flash-Next,同样发布即开源。价格砸到每百万Token输入1元、输出3元,是DeepSeek-V4-Flash的三分之一。

你品品这个画面。

以前,大模型这行里隐隐是两条路。一条更贵但更强的旗舰路线,一条更便宜但没那么顶的性价比路线。

但就在昨天,一个把旗舰级的分数塞进了Flash档,一个把千亿模型的激活量压到60亿再开源出去。

反过来也是一样。原本靠低价起家的那批玩家,这两年一直在拼命够智能的天花板。

一年前谁都不像谁,现在正在互相活成对方的样子。

说到底,是因为所有人都开始想同一个问题。

更高的智能和更高的性价比,到底能不能同时存在?

也是在昨天,闫俊杰在MiniMax的半年报业绩会上,给了个不一样的答案——

Minimize the Inference Cost, Maximize the Intelligence.

最小化推理成本,最大化智能水平。

Agent大军来袭,

Token消耗暴涨2000%

26日下午,MiniMax把半年报挂上港交所。

8月ARR突破8亿美元,B端收入同比涨703%,占比从去年的30%干到80%,7月Token消耗量是1月的20倍。

上半年收入1.166亿美元,同比涨283%,半年收了去年全年的1.5倍。

数字很炸,但真正值得琢磨的是:

M3比M2强了一大截,价格没涨,用量炸了。

按常理,降价才涨量。但MiniMax没降价,量也炸了。

这背后的原因在于,买Token的主力从人变成了Agent。

用户每点一次按钮,模型就得在后台跑上个几十轮。

闫俊杰表示,Agent带来的推理需求增速,已经快过用户数和消息数。而MiniMax企业和开发者数量突破200万,是去年底的10倍。

这就解释了为什么MiniMax B端收入能同比涨703%。真正把调用量快速放大的,是企业、开发者和Agent。

C端业务同期也翻倍,但硬是被一个翻八倍的业务挤成了配角。

一份算力掰成两半花,

把3T参数巨兽跑出白菜价

现在,模型智能的增量,越来越多来自后训练——强化学习、合成数据、大规模评测。

而这些环节的实质都是推理。RL的Rollout是推理,合成数据生成是推理,评测也是推理。推理算力在训练中的占比越来越高。

对此,闫俊杰在会上给了个量化的说法。

在相同的算力规模下,可以认为推理计算效率的提升倍数跟后训练的规模变大倍数基本线性相关。

换句话说就是,当你把推理效率提升三倍时,后训练就能做以前三倍的量。而后者的规模,直接决定了模型最后能聪明到什么程度。

所以降成本不是商业上的促销策略,而是一条技术路线。只有把推理成本继续压下来,才有算力资本把后训练继续往上Scaling。今天的推理,既是在卖智能,也是在生产下一代智能。

值得一提的是,MiniMax并没有为了省钱把模型做小,他们一直都在研发行业里最大的那一档模型。省钱不靠缩水,靠的是在同样大的模型上找到更优的架构。

一是MoE的稀疏度,专家稀疏压到2%以内还能收敛;二是Attention的稀疏,自研的MSA能大幅压缩长上下文的计算开销。

这就是「不用选」的技术含义:不是在模型智能和便宜之间挑一个,是把大模型跑便宜。

基建层面也是同一个逻辑。训练Agent,光有显卡不够,你得给模型搭一堆隔离环境,让它在里头真去跑代码、调工具、摔跟头,这些都跑在CPU上。

MiniMax的多模态推理集群本来就堆着大量CPU(跑视频和图像用的),闲下来直接调过去做训练。一份钱当两份花。

线上推理流量有潮汐,夜间低谷正好用来跑小规模验证实验和强化学习的Rollout。每一块闲置算力都被塞进了「生产下一代智能」的管道里。

落到实处,MiniMax接下来的两款模型就是这条路线的直接体现。

M3.1是M3的延续,继续在当前底座上扩大后训练规模,重点强化Coding、工具调用和Agent能力,更强调任务完成的质量和稳定性。

闫俊杰给它的定位是「一个能被大量、广泛使用的模型」。目标是把推理成本降到M3初版的三分之一。

M3 Pro则是一次全面的能力跃迁。参数规模推到约3T,在更大的底座上继续扩大强化学习和长程任务训练。

架构上搭载MSA 2.0。简单说,模型每回答一次,得先把你给的上下文从头读一遍,这一步叫Prefill,特别烧算力。

MSA 2.0把读过的东西存得更好、找得更快,命中率上去了,少重读一次,成本就成倍往下掉。

在最大参数档位上,计算效率预计能再提升3倍,而且任务越长、上下文越复杂,优势越明显。

3T的模型,卡从哪来?

MiniMax自己建了一套核心机房,专门跑最大的训练任务;不够的时候找云厂商租,弹性伸缩;线上推理的峰值则用Token Factory顶上去,避免自己囤太多闲置资源。

三条腿走路,既稳又不浪费。

这套训练集群97%的时间都在有效干活,只有3%是在等待、重启、协调。放在行业里,这个利用率相当高。

与此同时,M3和H3正在适配国产芯片,大规模国产算力集群很快也会接上真实的生产流量。

用最极限的成本喂出最野的智商

顺着这条线看,MiniMax那些看起来不相干的动作,其实都在同一条线上。

7月31日开源的视频模型H3,三周多下载2400万次,衍生出300多个公开模型,是今年全球下载量最高的模型之一。

它的背后,是语言模型对创作过程的深度参与。不只是作为一个解码器,而是真正去理解上下文和用户的意图。

而在此基础之上,更强的H3.1也已经在路上。

所以昨天这场混战,说到底是同一道题的三种解法。

有人说算力有价,该涨就涨。有人说要先讲性价比。

MiniMax说这题压根不该做选择——推理成本每降一分,能被Scaling的智能就多一分。

闫俊杰在业绩会最后讲了一段话:「大语言模型行业不是零和竞争。任何一家公司的技术进步,只要能把智能的边界向前推进,最终都会扩大整个行业的价值空间。」

下一阶段的竞争,可能真的不比谁最贵,也不比谁最便宜。比的是谁能用最低的单位智能成本,把智能一路Scaling到最高。

编辑:所罗门 摩西

了解更多

猜你想看

← 返回首页