单价便宜97%分数还反超,DeepSeek新模型把GPT-5.6按在地上摩擦

栏目:互联网 | 来源:不掉线电波 | 2026-09-12 13:30

9月10日,DeepSeek 开源了 V4.1 Flash,MIT 许可,总参数 552B,输入阶段激活 8B、输出阶段激活 16B,支持 100 万 token 上下文和图像输入。

同台的两个闭源旗舰,GPT-5.6 Sol 是 7 月 9 日公开的,Claude Opus 5 是 7 月 24 日发的。三家都在主打 Agent 编程,但 DeepSeek 这次把定价和分数摆在一起看,反差最大。

价格上,V4.1 Flash 高峰期输出价 8 元每百万 token。GPT-5.6 Sol 是 20 美元,按 1 美元 7.1 元算约 142 元;Claude Opus 5 是 25 美元,约 178 元。

算下来,V4.1 Flash 的输出价不到 Sol 的 6%。跟 Opus 5 比,闲时价只有后者的 2.3% 左右,便宜了约 97%。

缓存命中的输入差得更多。V4.1 Flash 是 0.04 元,Opus 5 是 0.5 美元,相差约 90 倍。

分数这一块,DeepSeek 技术报告里有一张统一测试,三款都跑在最高推理强度。DeepSWE v1.1 上,V4.1 Flash 拿 74.2 分,GPT-5.6 Sol 是 73.0,Opus 5 是 74.0,V4.1 Flash 反而是三个里最高的。

Terminal-Bench 2.1 上三家都在 89 到 90 分,基本持平。中低难度的 Agent 编程任务,这个便宜了一个数量级的开源模型,分数已经反超或者打平两家闭源旗舰。

价格能压到这么低,是结构不一样。DeepSeek 用了 Causal Encoder-Decoder 的非对称设计,输入编码只激活 8B、输出解码激活 16B,专门针对输入远多于输出的 Agent 场景,KV Cache 压到每 token 890 字节。它也是三款里唯一公开结构细节、唯一能私有化部署的。

不过便宜和反超不是在所有项目上都成立。难度一上去,闭源旗舰还是领先。

Terminal-Bench 4.0 上 Opus 5 比 V4.1 Flash 高 20 多分,HLE 高近 20 分,从零搭仓库的 NL2Repo-Bench 高约 10 分,视觉 Agent 也领先 5 分左右。DeepSeek 报告自己都承认视觉这块跟闭源有差距。

中低难度、批量、成本敏感的 Agent 编程,V4.1 Flash 用不到对手 6% 的价格,拿到了持平甚至反超的分数,这是它压过 GPT-5.6 的地方。高难推理和视觉任务,多付的钱确实买到了更高的成功率。多数团队更现实的用法,是拿 V4.1 Flash 承接常规请求,高难任务再升级到闭源模型,整体成本能压到纯闭源方案的两三成。

了解更多

猜你想看

← 返回首页