
8月17日-23日大模型发布追踪:DeepSeek 视觉 API 与 Muse Spark 1.2
本期聚焦 DeepSeek-V4-Flash-Vision-Exp 的视觉 API 上线与计费,以及 Muse Spark 1.2 的多模态工具能力,给出评测口径、价格边界和三组可复测的选型任务。
一句话判断
8 月 17 日至 23 日,真正值得进入选型测试的模型级变化有两项:DeepSeek-V4-Flash-Vision-Exp 在 8 月 21 日把视觉输入接入 V4-Flash 的 Agent、推理和工具调用能力,并直接开放 API;Meta 则在本周公开 Muse Spark 1.2 的多模态评测和工具使用结果,继续把它推向代码 Agent、视觉编程和长任务执行。两者都在补「看见之后执行」这一步,前者已经给出清晰的 API 计费与接口,后者的公开价格主要来自托管平台,仍需把 Meta Model API 的实际账单单独核对。1234
先看价格、状态和边界
| 条目 | 本周确认的变化 | 可用性 / 价格 | 读者该先做什么 |
|---|---|---|---|
| DeepSeek-V4-Flash-Vision-Exp | 8 月 21 日发布实验性多模态版本;文本能力对齐 V4-Flash,并加入视觉理解与工具协作 | DeepSeek API 已上线,支持 Chat Completions、Messages 和 Responses;上下文 1M,最大输出 384K;图片按尺寸转成输入 token,每张最多 384 tokens,沿用 V4-Flash 价格:峰时输入缓存命中 / 未命中 / 输出为 $0.014 / $0.44 / $1.32,非峰时为 $0.007 / $0.22 / $0.66,每百万 tokens 计价 125 | 把截图、图表和带工具的视觉 Agent 放进同一组测试,记录图片 token、工具调用成功率和完整任务成本 |
| Muse Spark 1.2 | Meta 在 8 月 20 日公开新的多模态评测与演示;官方称它能把图像 / 视频转成可运行网页、游戏和机器人行动计划 | Muse Spark 1.2 可通过 Meta Model API 和 Muse Code 使用;Meta 的官方文章没有列出价格;OpenRouter 的 Muse Spark 1.2 Contributor 页面列出 1M 上下文、输入 $0.10、输出 $0.20 / 百万 tokens,这是托管平台价格,不等同于 Meta 官方 API 报价 34 | 测图像到网页、视频到网页和多轮工具调用;把托管平台的低价与 Meta Model API 的真实配额分开记录 |
本期条目的日期指原始详情页或厂商更新列表标出的发布时间。Muse Spark 1.2 的首次发布文章在 8 月 5 日,早于本期窗口;本周纳入的是 Meta 在 8 月 20 日发布的多模态评测、演示和公开使用状态,正文把它作为「模型更新」而非首次发布处理。36
DeepSeek-V4-Flash-Vision-Exp:视觉输入进入同一套 Agent 接口
DeepSeek 在 8 月 21 日上线
deepseek-v4-flash-vision-exp。这个版本保留 V4-Flash 在 Agent、推理和世界知识方面的文本能力,再接受图像输入,并把视觉理解接到多种工具上。DeepSeek Harness 0.1.1 也在同一公告中加入了开箱即用的支持。2调用层面的变化比较清楚:模型支持 Chat Completions、Messages 和 Responses;图片可以通过 Base64、外部 URL 或 Files API 传入;Files API 可以免费上传一张图片,再用
file_id 在后续请求中重复引用。对于需要反复检查同一份截图、图表或界面的 Agent,这个接口减少了重复上传,也让视觉输入更容易嵌入已有的文本 Agent 流程。2计费规则需要单独看。DeepSeek 的价格页把
deepseek-v4-flash-vision-exp 列为 1M 上下文、最大输出 384K 的模型;图片会按照尺寸转换成输入 token,每张图片最多计 384 tokens,并与文本输入一起计费。页面列出的 V4-Flash 价格是:峰时缓存命中输入 $0.014、缓存未命中输入 $0.44、输出 $1.32;非峰时分别为 $0.007、$0.22、$0.66。页面定义的峰时为工作日 01:00—04:00 和 06:00—10:00 UTC,换算为北京时间是工作日 09:00—12:00 和 14:00—18:00;其余时间为非峰时。5
DeepSeek 公布的表格把文本型 Agent 评测和多模态 Agent 评测放在一起。V4-Flash-Vision-Exp 在 Terminal Bench 2.1 上为 83.9,V4-Flash-0731 为 82.7,Opus-4.8 为 85.0;在 DeepSWE 上三者分别为 59.3、54.4 和 58.0;在 Toolathlon-Verified 上分别为 75.9、70.3 和 76.2。多模态项目 ApexBench 的 Pass@1 分数分别为 36.5、26.2 和 39.4,Agents' Last Exam 分别为 27.3、25.2 和 25.7。2
这些数字能支持一个较窄的判断:DeepSeek 的新版本相对 V4-Flash-0731 在这张官方表格里的多数项目有所上升,尤其是 DeepSWE、Toolathlon-Verified 和 ApexBench;它与 Opus-4.8 的差距因项目而变,不能概括成全面领先。官方说明还写明,文本型 Agent 公开评测使用 DeepSeek Harness Minimal Mode,
max tokens 设为最大值,top_p=0.95,temperature=1.0。因此,读者复测时至少要保存 harness、采样参数、图片尺寸和图片数量。2这款模型最适合先测三类任务:第一类是从截图或图表提取结构化信息,再调用搜索、数据库或代码工具;第二类是给 Agent 一组界面图片,让它识别状态并完成下一步操作;第三类是把同一张图片通过 Files API 复用多次,比较缓存、上传和重复推理对总成本的影响。评测时应把「看懂图片」和「完成任务」分成两项指标,否则单次识图准确率会掩盖工具调用失败。
Muse Spark 1.2:工具使用放大了多模态提升
Meta 在 8 月 20 日发布的文章称,Muse Spark 1.2 是 Muse Spark 1.1 的编码模型更新;文章这次补充的是多模态能力、工具使用结果和演示。Meta Model API 与 Muse Code 都已提供 Muse Spark 1.2。模型可以处理文本、图像和视频,把图像或视频中的布局、层级和风格转成网页或游戏代码,再重新检查生成结果。3
Meta 给出的综合结果显示,Muse Spark 1.2 在不使用工具时的平均分为 59.8,使用工具后为 72.0;Muse Spark 1.1 对应为 60.2 和 69.1。这个比较的重点不是裸模型分数,而是工具是否让模型更充分地检查视觉输入并把检查结果放进后续推理。3
在 Meta 公开的带工具评测里,Muse Spark 1.2 在 ZeroBench 上为 54.0%,排在 GPT-5.6 Sol 的 54.6% 之后,高于 Opus 5 的 47.5%、Muse Spark 1.1 的 46.0% 和 Gemini 3.7 Flash 的 30.0%;在 SimpleVQA 上为 75.0%,低于 Gemini 3.7 Flash 的 77.8%,高于 Muse Spark 1.1 的 73.3%;在 CharXiv Reasoning 上为 87.6%,低于 Opus 5 的 89.3%、Gemini 3.7 Flash 的 88.7% 和 Muse Spark 1.1 的 88.4%。这些数字来自 Meta 的官方文章,评测定义和样本应以 Meta 同文提供的方法报告为准。3

Muse Spark 1.2 的使用边界比一张代码榜单更宽。Meta 的演示包括视频转网页、视觉编程和机器人长任务规划:高层模型先理解场景、区分相似物体并拆分子任务,低层视觉—语言—动作策略再执行具体动作。Meta 还介绍了音视频理解与实时搜索、网页开发和空间定位工具的组合。3
价格目前要分成两层理解。Meta 官方多模态文章只说明 Muse Spark 1.2 可以通过 Meta Model API 和 Muse Code 使用,没有列出官方 API 单价。OpenRouter 的 Muse Spark 1.2 Contributor 页面列出 1,048,576 tokens 上下文、输入 $0.10、输出 $0.20 / 百万 tokens,并标注 2026 年 8 月 21 日发布。这个页面可以用来估算一个托管入口的成本,却不能代替 Meta Model API 的正式报价、配额和数据处理条款。34
如果团队要验证 Muse Spark 1.2,建议把输入分成三组:静态设计稿到网页、短视频到可运行页面、带多个工具调用的长周期代码任务。第一组看布局和样式还原,第二组看跨帧信息是否被正确转成页面结构,第三组看计划、代码修改、测试和恢复失败是否能连成一条完整链路。Meta Model API、Muse Code 和 OpenRouter 的结果应分别记录,避免把产品外壳、模型能力和托管价格混在一起。
第三方价格:本周只能确认一个托管入口
本期没有把 Artificial Analysis 的 DeepSeek-V4-Flash-Vision-Exp 页面写进横向表。该页面在本次抓取中只返回站点壳,缺少模型数据;这个缺口不足以支撑版本、推理设置、速度和综合指数的比较。Artificial Analysis 仍适合作为后续横向评测入口,但本期只使用能完整打开的厂商原文与 OpenRouter 详情页。
目前能直接拿来做成本基线的是 OpenRouter 页面列出的 Muse Spark 1.2 Contributor:输入 $0.10、输出 $0.20 / 百万 tokens,上下文约 1M。这个价格对应 Contributor 变体和 OpenRouter 托管入口,读者在内部成本表里应单独标出「平台报价」,并继续核对实际延迟、限流、隐私选项和模型版本。4
DeepSeek 的价格则已有官方口径。V4-Flash-Vision-Exp 与 V4-Flash 共用价格档位,峰时输入缓存未命中 $0.44、输出 $1.32,非峰时输入缓存未命中 $0.22、输出 $0.66;图片输入还会按尺寸转成 token。两者不能只比较「每百万输出 token」:DeepSeek 的视觉图片计费、峰谷时段和 Files API 复用都会改变总账单,Muse Spark 的托管平台价格也未覆盖 Meta 官方 API 的实际条件。45
本期未纳入与面向选型的行动
Qwen3.8-27B、Qwen3.8-Max 和 DeepSeek-V4-Pro 已在前几期按模型发布或可用性变化覆盖,本期没有把它们重新写成新条目。Qwen3.8-27B 的本周新量化和社区适配信息没有形成新的厂商模型发布,Qwen3.8-Max 的权重进展也已出现在上一期的时间窗里。重复覆盖会削弱本期的时间边界,所以正文只保留本周新出现的 DeepSeek 视觉 API 与 Meta 的 Muse Spark 1.2 多模态更新。
Anthropic、OpenAI、Google、智谱 GLM、月之暗面 Kimi 和 MiniMax 在本次检索中没有拿到同时满足三项条件的模型级条目:原始详情页可读、发布时间落在 8 月 17 日至 23 日、能力或可用性变化可以完整说明。搜索摘要、无法打开的页面壳和没有原始时间的传言都没有进入正文。
如果本周要把候选模型放进自己的任务集,先做三组最小测试:
- 视觉文档 Agent。 准备 20 张真实截图、图表和扫描文档,让模型完成信息提取、引用定位和一次工具查询。记录识别准确率、工具调用成功率、图片 token、首 token 延迟和完整任务成本。DeepSeek-V4-Flash-Vision-Exp 需要同时测试 Base64、外部 URL 与 Files API 的差异。2
- 代码库 Agent。 选择一个有测试的真实仓库,让 Muse Spark 1.2 通过 Muse Code 或 Meta Model API 完成计划、修改、测试和失败恢复,再与团队当前模型比较人工接管次数。Terminal-Bench 2.1 的分数只用于缩短候选清单,不能替代仓库内测试。6
- 长任务工具调用。 让两个模型处理一个需要连续观察、搜索、写入和复核的任务,单独统计每一步成功率。模型能读图与模型能把图像信息正确传给工具,是两个不同的能力;总成本还要加入失败重试和人工接管。
本周可以直接开始的工作是:用 DeepSeek 测视觉 API、图片计费和峰谷调度,用 Muse Spark 1.2 测视频到网页、视觉编程和代码库 Agent。DeepSeek 的价格与接口边界已经写在官方文档里,Muse Spark 1.2 的模型更新和评测信号已经公开;采购结论仍应等自己的任务集、账单和配额测试完成后再下判断。
References
- 1DeepSeek Change Log
api-docs.deepseek.com
- 2DeepSeek-V4-Flash-Vision-Exp Release: Multimodal API Now Live
api-docs.deepseek.com
- 3The Multimodal Intelligence of Muse Spark 1.2
research.meta.ai
- 4Muse Spark 1.2 Contributor - OpenRouter
openrouter.ai
- 5Models & Pricing
api-docs.deepseek.com
- 6Introducing Muse Code and Muse Spark 1.2
research.meta.ai
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
