刚刚,DeepSeek新模型上线,长文本缓存硬盘占用暴降88%!

栏目:互联网 | 来源:智东西 | 2026-09-10 16:15
智东西作者|毕伟豪编辑|李水青

智东西9月10日报道,刚刚,DeepSeek正式发布DeepSeek V4.1 Flash,该模型采用全新架构,是一款552B参数的MoE模型,为DeepSeek全新模型架构系列中尺寸最小的成员,在性能上超越了包括DeepSeek V4 Pro在内的一众旗舰模型

模型开源地址:

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

论文链接:

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

同时,DeepSeek App显示已完成全新升级,整合了快速、专家和识图模式,并上线了新模型,网页端应该也已同步上新。

一、性能全面超越旗舰,定价下调

价格方面,得益于模型架构的创新,与DeepSeek V4 Flash相比,DeepSeek下调了V4.1 Flash的定价,峰谷定价机制被保留,闲时价格为高峰时段价格的一半,官方鼓励用户根据实际使用情况调整任务时间。

全新定价为闲时输入(缓存命中)0.02元、未命中1.0元、输出4.0元,高峰时段输入(缓存命中)0.04元,未命中2.0元,输出8.0元,新价格已于2026年9月10日12:00正式生效。

▲DeepSeek V4.1 Flash定价表(图源:DeepSeek)

该模型具备原生多模态视觉理解能力,采用了全新的Causal-Encoder-Decoder架构,输入和输出不对称,输入激活参数只有8B,输出激活为16B,成本显著低于已知的同尺寸模型。

▲DeepSeek-V4.1-Flash与主流前沿模型在Agentic Benchmark上的性能对比(图源:DeepSeek)

同时,在新的预训练方式和更大规模强化学习后训练的加持下,这款更小尺寸的模型在Agentic Benchmark等基准测试中超越了DeepSeek V4 Pro、GLM5.3、Kimi-K3等多款前沿旗舰模型。

▲DeepSeek-V4.1-Flash与主流前沿模型在Agentic Benchmark上的性能对比(图源:DeepSeek)

官方在公告中给出了新模型架构的设计初衷:能力上限更高、推理速度更快、吞吐更大,并且可以扩展到更大参数规模的模型

二、缓存大幅压缩,DeepSeek V4 Pro即将退场

新一代模型在KV Cache缓存效率方面有了大幅提升,与DeepSeek V4 Flash相比,V4.1 Flash对HBM的需求减少到1/4,对SSD的需求减少到1/8。DeepSeek官方称,初代模型DeepSeek V1的KV Cache是DeepSeek V4.1 Flash的437倍

▲DeepSeek在减少上下文存储方面的持续进展(图源:DeepSeek)

这一次压缩由架构、缓存精度和部署策略三方协同完成。架构上,新模型采用CSA2(压缩稀疏注意力2)机制,将全局KV缓存和Top-K索引跨层复用,每一层只保留自己的查询向量和局部注意力缓存,重复存储被大幅砍掉。

缓存精度方面,模型从训练阶段就直接用FP4格式存储全局KV缓存,官方称性能损失几乎可以忽略。部署一侧,新增SWA有界重放机制,只需重放最近的n个token,就能近似重建滑动窗口注意力(SWA)所需的状态,SWA缓存因此不必再写入SSD,持久化缓存的占用进一步压到V4 Flash的1/8。

这些设计叠加,把上下文从4K拉长到1M,单token解码FLOPs只增加约四分之一,解码成本几乎不随上下文长度增长。

▲DeepSeek-V4.1-Flash上下文长度和前代模型对比(图源:DeepSeek)

这项数字直接关系到用户账单,在Agent使用场景中,缓存命中的费用往往占比较高,KV Cache的压缩大幅降低了Agent类任务的使用成本。对需要长上下文、多轮调用的Agent工作流来说,同样的预算能跑更多的任务。

目前,DeepSeek V4.1 Flash已同步上线DeepSeek API,用户将模型名称改为deepseek-flash即可调用V4.1 Flash,旧版本模型V4 Flash与V4 Flash Vision Exp现已下线,模型名deepseek-v4-flash、deepseek-v4-flash-vision-exp将被暂时路由到V4.1 Flash。

昨日,DeepSeek方面宣布,由于在多方测试中DeepSeek V4.1 Flash的各项指标全面超越DeepSeek V4 Pro,因此DeepSeek将从北京时间9月14日12:00起有序下线V4 Pro,所有deepseek-v4-pro的请求都将被路由到新模型,按V4.1 Flash单价计费。

▲DeepSeek模型调整公告(图源:DeepSeek)

三、全力支持开源,WorkBuddy、OpenCode全量接入

除模型能力之外,DeepSeek在开源和生态方面也有一系列动作。

DeepSeek今日宣布将会全力支持开源社区进行新模型的推理适配,并尝试通过各种方式扩大部署的范围。如果用户有大规模部署的需求且具备相应的资源(2k卡GPU、有存储集群),可以与DeepSeek联系。

刚刚,DeepSeek Harness v0.1.5版本同步上线,DeepSeek V4.1 Flash模型针对DeepSeek Harness进行了专项训练和优化,用户在使用DeepSeek V4.1 Flash模型时,DeepSeek Harness新版本还支持在保留已有KV Cache的情况下更新系统提示词。

生态侧,腾讯(WorkBuddy、CodeBuddy等)和OpenCode作为官方合作伙伴,现已全量接入DeepSeek V4.1 Flash,OpenCode Go套餐提供了4倍使用额度。

▲OpenCode模型使用额度表(图源:OpenCode)

WorkBuddy中同样提供限时两周的独家优惠,腾讯云TokenHub、ima、Marvis、CodeBuddy同步接入DeepSeek V4.1 Flash。而在此前路透社关于DeepSeek融资的相关报道中,腾讯正是DeepSeek投资人之一。

同期开源的还有DeepJIT,一个轻量级的xPU内核JIT编译库,同时支持NVIDIA CUDA GPU和华为昇腾NPU两大后端,为推理侧的内核编译提供统一接口和跨节点共享缓存能力。

结语:最小模型反超旗舰,推理成本持续下降

DeepSeek V4.1 Flash这款模型,在用全新架构将成本压低的同时,用更大规模的强化学习将智能水平拉高,以更小的尺寸在自家产品线上完成了对旗舰的全面超越。

对高频使用Agent的用户来说,缓存压缩和价格的降低叠加,实际账单的变化会比基准分数体感更强。

从更长的时间线看,官方宣称新架构可扩展到更大参数的模型,我们或可期待一下即将到来的DeepSeek全新旗舰模型。

可以看到,DeepSeek的产品线正围绕新架构重新排序。V4 Pro的有序下线只是这次更替的开始,后续更大参数的模型能把前沿模型的性价比推到什么程度,值得期待。

了解更多

猜你想看

← 返回首页