DeepSeek V4-Flash补上"眼睛":多模态实验版上线,Opus 4.8被追平

栏目:互联网/干货 | 来源:网易智能 | 2026-08-21 18:11

8月21日,DeepSeek给V4-Flash补上了"眼睛":多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp上线并开放API,但仍是实验版本,用户需要在调用时手动指定模型名称(deepseek-v4-flash-vision-exp)才能访问。官方本次没有提及网页端和App的开放安排。

新模型可以读取截图中的文字、理解图表和页面布局,也能把图片与文字指令放在同一次任务中处理。这意味着智能体不必再让人"用文字描述图片"。对需要查看网页、分析界面、整理图文资料的Agent来说,这是一次能力补齐。

与Opus 4.8互有胜负

DeepSeek公布的对比数据显示,V4-Flash-Vision-Exp在多个Agent benchmark上与Anthropic的Claude Opus 4.8互有胜负:

  • 领先项:DeepSWE(59.3 vs 58.0)、Agents' Last Exam(27.3 vs 25.7)、ZeroBench(35.0 vs 34.0)
  • 追平项:Terminal Bench 2.1(83.9 vs 85.0)、Toolathlon-Verified(75.9 vs 76.2)、Chartography(64.3 vs 65.0)
  • 落后项:NL2Repo(57.7 vs 69.7)、DSBench-Hard(63.6 vs 71.7),差距在8-12分

与自家文本版DeepSeek V4-Flash-0731对比,视觉版在纯文本任务上基本持平,但在需要看图的多模态测试上大幅领先:ApexBench从26.2涨到36.5,Agents' Last Exam从25.2涨到27.3。视觉能力的加入并没有拖累原有的文本表现,这是这次实验版最关键的信号。

视觉不是用来"看图说话"

官方放出的三个演示都不是识图问答这种基础任务:一个是给高净值客户做西藏自驾游PPT,要求野性、粗粝、有实拍质感;一个是按黑蓝深海、玻璃UI、ASCII像素等视觉要素重构DeepSeek Harness官网;还有一个是做带黏土怪物动效的网页Demo。

三个案例的共同点是:模型要先看懂图片、页面结构和设计意图,再调用工具产出PPT或代码。DeepSeek想展示的不是"能看图",而是视觉能力嵌进完整的Agent工作流。

API与计费

API支持三种主流调用格式(Chat Completions、Messages、Responses),图片可以通过链接、Base64或先上传再引用的方式传入。图片会被转换成token计费,一张图最多折算384 tokens,与文字输入统一定价,整体价格与文本版V4-Flash保持一致。

同时上线的还有Files API:用户可以先把图片上传到平台,之后在多次请求中通过file_id复用,避免反复上传。这个接口本身不收费,但模型每次处理图片产生的token仍会正常计费。对需要重复分析同一批截图、图表的工作流来说,这个功能主要省的是带宽,不是推理成本。(易句)

(本文由AI翻译,网易编辑负责校对)

了解更多

猜你想看

← 返回首页