DeepSeek-V4-Flash-Vision-Exp 发布:官方称多模态 Agent 接近 Opus-4.8,API 已上线

DeepSeek-V4-Flash-Vision-Exp 发布:官方称多模态 Agent 接近 Opus-4.8,API 已上线

DeepSeek 于 2026 年 8 月 21 日上线实验性多模态模型 V4-Flash-Vision-Exp,公开图片输入、三类 API、按 V4-Flash 计费和多模态 Agent benchmark,开发者可据此开始真实任务评测。

先看结论

DeepSeek 在北京时间 2026 年 8 月 21 日 17:17 发布了实验性多模态模型 deepseek-v4-flash-vision-exp。模型已经在 DeepSeek API Platform 上线,图片输入按 V4-Flash 的价格计费,每张图片最多计 384 个 token;接口支持 Chat Completions、Messages 和 Responses。12
这次发布的重点,是把 V4-Flash 的文本 Agent、推理和世界知识能力,接到图片理解和工具调用上。DeepSeek 称,它在多模态 Agent 评测中相比 V4-Flash 有明显提升,表现接近 Opus-4.8。这个结论来自厂商自报 benchmark,适合用来决定测试方向,结论范围限定在官方公开的评测项目。1

它比 V4-Flash 多了什么

模型可以同时接收文字和图片,用于描述图片、读取截图文字、分析图表,再把视觉结果交给 Agent 工作流中的工具继续处理。官方发布页还展示了它在不同 Agent 框架中的多模态用法。13
模型家族、规格和可用信息可以先按下面这张表理解:
项目当前可确认的信息
模型定位DeepSeek-V4-Flash 的实验性视觉版本;文本能力对齐 V4-Flash,覆盖 Agent、推理和世界知识。1
模型 ID模型 ID 为 deepseek-v4-flash-vision-exp1
参数规模官方未披露。1
上下文窗口与地区本次发布页和视觉指南尚未公开新的上下文窗口数值与地区清单;已确认的可用范围是 DeepSeek API Platform。13
视觉输入支持 JPEG、PNG、GIF、WebP;图片可以通过 Base64、公开图片 URL 或 Files API 传入。3
「实验性」是当前最重要的使用边界。开发团队可以马上做 API 评测,但生产接入仍应保留灰度开关、人工复核和异常回退路径。

benchmark:视觉 Agent 是主要增量

DeepSeek 官方对照图同时列出了文本 Agent 和多模态 Agent 评测。几个有代表性的分数如下:
评测V4-Flash-Vision-ExpV4-Flash-0731Opus-4.8
Terminal Bench 2.183.982.785.0 1
DeepSWE59.354.458.0 1
ApexBench(Pass@1)36.526.2*39.4 1
Agents' Last Exam27.325.2*25.7 1
Chartography64.365.0 1
ZeroBench(Pass@5)35.034.0 1
DeepSeek 官方 benchmark 对照图
DeepSeek 官方图比较了 V4-Flash-Vision-Exp、V4-Flash-0731 和 Opus-4.8;图中说明,公开 benchmark 网站上的代码 Agent 文本任务使用 DeepSeek Harness Minimal Mode,ApexBench 和 Agents' Last Exam 中的文本版 V4-Flash 会忽略其中的多模态元素。1
表格能看出两个边界。第一,文本任务上的提升并不统一:Terminal Bench 2.1 和 DeepSWE 高于 V4-Flash-0731,但仍低于 Opus-4.8;CyberGym、NL2Repo 等其他项目也不能由单个分数代替。第二,多模态任务是这次升级的核心,Chartography 和 ZeroBench 直接提供了视觉或多模态场景,V4-Flash-0731 在官方图中没有对应分数。
因此,「接近 Opus-4.8」更准确的读法是:在 DeepSeek 公开的多模态 Agent 对照中,部分任务已经接近;这个结果适用于官方列出的评测项目,不能延伸为所有文本、视觉和工具任务的整体水平。上表所有数字都是 DeepSeek 自报结果,测试环境和参数以官方图中脚注为准。1

API、计费和接入限制

DeepSeek 官方指南给出的调用路径,已经覆盖常见的三种输入方式:
接入项官方信息对开发者的影响
API 形态支持 Chat Completions、Messages 和 Responses。13现有 OpenAI 兼容调用可以优先做模型 ID 和图片 content block 的兼容性回归。
图片输入可以直接传 Base64、公开 URL,或先上传到 Files API 再使用 file_id3反复使用同一张图时,Files API 可以减少重复上传;远程图片则要满足可访问和文件大小限制。
图片计费图片会转换成 token,并与文字 token 一起计费;每张图片最多计 384 个 token,价格沿用 V4-Flash。13预算要把图片数量、文字输入和输出 token 放在同一份调用成本里核算。
Files API官方发布页称 Files API 已上线且免费;同一张图上传一次后,可以在多个请求中通过 file_id 复用。14大图、重复图片和批量视觉任务更适合先走文件上传。
消息限制图片只支持放在 user 消息中;放在 systemassistant 消息会返回 400。只有视觉模型接受图片输入。3原有把图片放进系统提示词的封装需要调整,模型名称替换之外还要检查消息结构。
DeepSeek 官方模型与调用页已经把 deepseek-v4-flash-vision-exp 列为可用模型,并说明调用方式仍通过 DeepSeek API;V4-Flash 与 V4-Pro 的版本更新不改变原有模型名,Vision-Exp 则需要显式使用自己的模型 ID。4

现在适合怎样试

  1. 先做接口回归。 保留现有文本测试集,新增截图、表格、图表和网页界面样本,检查 content 数组、图片格式、URL 可访问性和异常处理。视觉输入的三种传法和格式限制,以官方 Vision 指南为准。3
  2. 再测真正的多模态 Agent。 让模型完成「看图理解状态—调用工具—根据工具结果继续行动」的完整任务,单独记录视觉识别偏差、工具调用偏差、人工接管次数和总耗时。图片问答测试覆盖不了这次发布的主要卖点。
  3. 把价格换算成单任务成本。 统计每个任务的图片数量、每张图的计费 token、文字输入和输出 token,再按 V4-Flash 当前价格计算;同一图片多次复用时,优先测试 Files API。13
  4. 实验阶段先保留人工边界。 重点测试图片中的提示词注入、敏感信息、图表读错和工具误操作。模型已经可以接入 API,实验性标签仍然要求团队把这些异常场景测完,再决定是否扩大流量。
对开发者来说,这次更新已经跨过「只能看演示」的门槛:模型 ID、三类 API、图片输入和计费规则都已公开。最值得立刻验证的方向,是它在真实截图、图表和工具链任务中能否把视觉理解转化成稳定行动,判断依据应放在真实任务结果上,而非一张官方榜单上的分数。

References

  1. 1
    DeepSeek 官方发布页api-docs.deepseek.com
  2. 2
  3. 3
    DeepSeek Vision API 指南api-docs.deepseek.com
  4. 4
    DeepSeek API 调用与模型页api-docs.deepseek.com
大模型发布追踪

大模型发布追踪

追踪各大厂商最新大模型发布,第一时间推送核心信息

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.