
DeepSeek-V4-Flash-Vision-Exp 发布:官方称多模态 Agent 接近 Opus-4.8,API 已上线
DeepSeek 于 2026 年 8 月 21 日上线实验性多模态模型 V4-Flash-Vision-Exp,公开图片输入、三类 API、按 V4-Flash 计费和多模态 Agent benchmark,开发者可据此开始真实任务评测。
先看结论
DeepSeek 在北京时间 2026 年 8 月 21 日 17:17 发布了实验性多模态模型
deepseek-v4-flash-vision-exp。模型已经在 DeepSeek API Platform 上线,图片输入按 V4-Flash 的价格计费,每张图片最多计 384 个 token;接口支持 Chat Completions、Messages 和 Responses。12这次发布的重点,是把 V4-Flash 的文本 Agent、推理和世界知识能力,接到图片理解和工具调用上。DeepSeek 称,它在多模态 Agent 评测中相比 V4-Flash 有明显提升,表现接近 Opus-4.8。这个结论来自厂商自报 benchmark,适合用来决定测试方向,结论范围限定在官方公开的评测项目。1
它比 V4-Flash 多了什么
模型家族、规格和可用信息可以先按下面这张表理解:
| 项目 | 当前可确认的信息 |
|---|---|
| 模型定位 | DeepSeek-V4-Flash 的实验性视觉版本;文本能力对齐 V4-Flash,覆盖 Agent、推理和世界知识。1 |
| 模型 ID | 模型 ID 为 deepseek-v4-flash-vision-exp。1 |
| 参数规模 | 官方未披露。1 |
| 上下文窗口与地区 | 本次发布页和视觉指南尚未公开新的上下文窗口数值与地区清单;已确认的可用范围是 DeepSeek API Platform。13 |
| 视觉输入 | 支持 JPEG、PNG、GIF、WebP;图片可以通过 Base64、公开图片 URL 或 Files API 传入。3 |
「实验性」是当前最重要的使用边界。开发团队可以马上做 API 评测,但生产接入仍应保留灰度开关、人工复核和异常回退路径。
benchmark:视觉 Agent 是主要增量
DeepSeek 官方对照图同时列出了文本 Agent 和多模态 Agent 评测。几个有代表性的分数如下:
| 评测 | V4-Flash-Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 1 |
| DeepSWE | 59.3 | 54.4 | 58.0 1 |
| ApexBench(Pass@1) | 36.5 | 26.2* | 39.4 1 |
| Agents' Last Exam | 27.3 | 25.2* | 25.7 1 |
| Chartography | 64.3 | — | 65.0 1 |
| ZeroBench(Pass@5) | 35.0 | — | 34.0 1 |

表格能看出两个边界。第一,文本任务上的提升并不统一:Terminal Bench 2.1 和 DeepSWE 高于 V4-Flash-0731,但仍低于 Opus-4.8;CyberGym、NL2Repo 等其他项目也不能由单个分数代替。第二,多模态任务是这次升级的核心,Chartography 和 ZeroBench 直接提供了视觉或多模态场景,V4-Flash-0731 在官方图中没有对应分数。
因此,「接近 Opus-4.8」更准确的读法是:在 DeepSeek 公开的多模态 Agent 对照中,部分任务已经接近;这个结果适用于官方列出的评测项目,不能延伸为所有文本、视觉和工具任务的整体水平。上表所有数字都是 DeepSeek 自报结果,测试环境和参数以官方图中脚注为准。1
API、计费和接入限制
DeepSeek 官方指南给出的调用路径,已经覆盖常见的三种输入方式:
| 接入项 | 官方信息 | 对开发者的影响 |
|---|---|---|
| API 形态 | 支持 Chat Completions、Messages 和 Responses。13 | 现有 OpenAI 兼容调用可以优先做模型 ID 和图片 content block 的兼容性回归。 |
| 图片输入 | 可以直接传 Base64、公开 URL,或先上传到 Files API 再使用 file_id。3 | 反复使用同一张图时,Files API 可以减少重复上传;远程图片则要满足可访问和文件大小限制。 |
| 图片计费 | 图片会转换成 token,并与文字 token 一起计费;每张图片最多计 384 个 token,价格沿用 V4-Flash。13 | 预算要把图片数量、文字输入和输出 token 放在同一份调用成本里核算。 |
| Files API | 官方发布页称 Files API 已上线且免费;同一张图上传一次后,可以在多个请求中通过 file_id 复用。14 | 大图、重复图片和批量视觉任务更适合先走文件上传。 |
| 消息限制 | 图片只支持放在 user 消息中;放在 system 或 assistant 消息会返回 400。只有视觉模型接受图片输入。3 | 原有把图片放进系统提示词的封装需要调整,模型名称替换之外还要检查消息结构。 |
DeepSeek 官方模型与调用页已经把
deepseek-v4-flash-vision-exp 列为可用模型,并说明调用方式仍通过 DeepSeek API;V4-Flash 与 V4-Pro 的版本更新不改变原有模型名,Vision-Exp 则需要显式使用自己的模型 ID。4现在适合怎样试
- 先做接口回归。 保留现有文本测试集,新增截图、表格、图表和网页界面样本,检查
content数组、图片格式、URL 可访问性和异常处理。视觉输入的三种传法和格式限制,以官方 Vision 指南为准。3 - 再测真正的多模态 Agent。 让模型完成「看图理解状态—调用工具—根据工具结果继续行动」的完整任务,单独记录视觉识别偏差、工具调用偏差、人工接管次数和总耗时。图片问答测试覆盖不了这次发布的主要卖点。
- 把价格换算成单任务成本。 统计每个任务的图片数量、每张图的计费 token、文字输入和输出 token,再按 V4-Flash 当前价格计算;同一图片多次复用时,优先测试 Files API。13
- 实验阶段先保留人工边界。 重点测试图片中的提示词注入、敏感信息、图表读错和工具误操作。模型已经可以接入 API,实验性标签仍然要求团队把这些异常场景测完,再决定是否扩大流量。
对开发者来说,这次更新已经跨过「只能看演示」的门槛:模型 ID、三类 API、图片输入和计费规则都已公开。最值得立刻验证的方向,是它在真实截图、图表和工具链任务中能否把视觉理解转化成稳定行动,判断依据应放在真实任务结果上,而非一张官方榜单上的分数。
References
- 1DeepSeek 官方发布页
api-docs.deepseek.com
- 2DeepSeek 官方发布帖
x.com
- 3DeepSeek Vision API 指南
api-docs.deepseek.com
- 4DeepSeek API 调用与模型页
api-docs.deepseek.com

大模型发布追踪
追踪各大厂商最新大模型发布,第一时间推送核心信息
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.