8月1日零点知乎热榜:DeepSeek V4 Flash 正式版上线,Agent 跑分强但不是全端升级

8月1日零点知乎热榜:DeepSeek V4 Flash 正式版上线,Agent 跑分强但不是全端升级

DeepSeek-V4-Flash-0731进入 API 公测,真正升级的是 Agent 后训练与接口适配,而不是 App、网页端和 V4-Pro 同步换代。

截至 2026 年 8 月 1 日 00:00,本轮知乎热榜工具实际返回 30 条。最明确的 AI 新事实只有一组:DeepSeek-V4-Flash-0731 已进入 API 公测,但这不是 App、网页端和 V4-Pro 一起升级。它的看点在 Agent 任务的后训练和接口适配,官方跑分很强,真实价值仍要看独立复现和实际任务成本。
综合排序知乎热榜问题榜单信息本期判断
1DeepSeek V4 flash 正式版发布,有哪些亮点值得关注?第 1 名,2511 万热度,592 个回答这是发布事实本身,重点看 API、Agent 基准与模型边界。1
2DeepSeek V4 正式版发布,使用体验如何?和降价后的 GPT5.6 luna 对比谁更有优势?第 5 名,224 万热度,39 个回答这是同一发布的体验和价格讨论,不能另算一条新品。2

发生了什么

DeepSeek 官方更新日志把 7 月 31 日的变化写得很清楚:DeepSeek-V4-Flash 正式版 API 进入公测,调用模型名改为 deepseek-v4-flash,模型结构和尺寸与 V4-Flash-Preview 保持一致,只重新做了后训练。它原生支持 Responses API,并针对 Codex 做了适配。3
DeepSeek 官方账号在北京时间 7 月 31 日 14:56 发布了同一消息,表述重点是「Agent 能力大幅升级」和「超过 V4-Pro-Preview 的基准表现」。这条帖子能证明发布方的公开口径,不能单独证明所有真实开发任务都已经超过更大的模型。4
Loading content card…
这次发布还有三个容易被热榜标题混淆的边界:
  • 更新对象是 API。TechNode 报道确认,V4-Pro API 以及 DeepSeek App、网页端模型都没有随本次更新改变。V4-Pro 正式版仍是「即将发布」的状态。5
  • 模型没有换架构。这更像一次后训练和 Agent 交付能力的升级,而不是参数规模扩张或新一代基础模型重训。
  • Flash 和 Pro 仍不是同一档硬件规模。36 氪引用 DeepSeek 技术报告称,V4-Flash 总参数约 2840 亿、激活参数约 130 亿;V4-Pro 总参数约 1.6 万亿、激活参数约 490 亿。小模型在特定 Agent 任务上追近大模型,才是这次发布值得观察的地方。6

跑分强在哪里,不能说明什么

DeepSeek 公布了 9 项 Agent、代码和自动化测试结果:
测试组官方公布结果
Terminal Bench 2.1、NL2Repo、Cybergym、DeepSWE、Toolathlon verified82.7、54.2、76.7、54.4、70.3。3
Agent Last Exam、Automation Bench (Public)、DSBench-FullStack、DSBench-Hard25.2、25.1、68.7、59.6。后两项是内部测试集。3
这组数据说明 DeepSeek 正在把 Flash 的卖点从「便宜的通用模型」推向「能完成多步骤工作的 API」。但它有两个限制不能略过:公开 Code Agent 任务使用了即将发布的 DeepSeek Harness 极简模式,并采用 max effort、topp=0.95temperature=1.0;内部测试集的题目、样本和复现实验条件也没有公开。换句话说,分数能证明发布方选择了 Agent 作为主战场,暂时不能替代第三方的同条件横评。3
Artificial Analysis 的页面提供了另一把尺:V4 Flash 0731 的 Intelligence Index 为 50,记录的 API 价格为每百万输入 token 0.14 美元、输出 token 0.28 美元,上下文窗口为 100 万 token。该页面还标明它只支持文本输入输出,不支持图片输入。这个结果支持「低价、长上下文、Agent 任务」的产品定位,却也提醒开发者:需要视觉理解的工作流不能只看代码基准。7

外部实测给出的另一面

YouTube 上的中文评测「DeepSeek V4 Flash 全面实测」把模型接入 Claude Code,作者自报连续测试了游戏、SVG 动画、Manim 可视化和原生 iOS App,并记录了约 1.42 元的总成本。视频还指出,在复杂 Godot 游戏任务中上下文可能很快占满。这里有可复查的任务过程,但成绩、成本和「能否替代 Opus」仍是视频作者自己的测试口径,不能和官方基准混成一张排行榜。8
Loading content card…
这恰好把产品价值说得更准确:它可能已经适合承担代码生成、工具调用和长上下文分析中的一部分工作,但「一部分工作」不等于所有 Agent 工作。复杂项目还会受上下文管理、工具链、失败重试、输出审查和多模态输入限制影响。

知乎公开回答摘要:受限版

知乎答案接口本轮返回的是按更新时间排列的当前可见切片,不是可以证明为实时点赞全量排序的前三。下面按本次返回片段中的赞同数整理,读者应把它看成热榜讨论样本,而不是完整高赞榜。

第 1 名问题:发布亮点

当前可见的 5 条答案中,最高赞同数为 1,出现并列:
  1. 大海,1 赞:用同一提示词比较 V4-Pro 预览版和 V4-Flash 正式版,认为后者的文字表达少了「人机味」。这是单个用户体验,能说明感知差异,不能证明普遍性能提升。9
  2. 羊年春晚总导演,1 赞:把注意力放在 Flash 的参数规模、价格和 Agent 能力上,试图说明后训练和工程优化可以抵消部分规模差距;其中与其他模型的直接比较没有附同口径来源。10
  3. 平平淡淡,0 赞:回应集中在「又更新了」和对国产模型竞争的情绪化感受,没有提供可核验的技术细节。11

第 5 名问题:体验与价格比较

当前可见的 5 条答案中,最高一条有 55 赞,之后有两条各 1 赞:
  1. 极个别同志,55 赞:用调侃方式表达老板从吹捧其他模型到转向 DeepSeek 的反差,反映的是价格战和模型切换的讨论氛围,不是性能测试。12
  2. 情欣不念,1 赞:把 V4 Flash 放在 GPT5.6 Luna 降价后的竞争环境里,强调低价 Agent 模型的截击意味;其价格、跑分和对手比较属于答主转述,不能直接当作官方数据。13
  3. MNACSTMSYSD,1 赞:只留下「跑分出来了」和一张图片提示,无法从公开文字中恢复具体测试内容,因此只能记录为短评,不能扩写成观点。14

接下来观察什么

  1. V4-Pro 正式版是否真的按计划发布:如果 Pro 很快跟进,Flash 的定位会更像高性价比 Agent 主力;如果继续只有 Flash 更新,API 端可能会成为 DeepSeek 更快迭代的试验场。
  2. 官方 Harness 能否被外部复现:同一任务换用公开工具链、不同推理预算和不同失败重试策略后,分数是否仍然领先,决定这次升级是模型能力,还是模型与专用 Harness 的组合效果。
  3. 成本要按完成任务计算:0.14 美元的输入价格很低,但长上下文、重复调用和失败重试会改变最终账单。真正该比较的是完成一个代码修改、部署或研究任务需要多少 token 和人工检查。
  4. 多模态短板是否补上:当前第三方页面仍将它标为文本模型。对代码和文本 Agent 之外的图像、界面操作任务,不能沿用纯文本基准的结论。

来源边界

本轮 X 上有 DeepSeek 官方发布帖,YouTube 有具体实测,TechNode 和 Artificial Analysis 也提供了可打开的外部材料。微信公众号检索覆盖了 2026 年 7 月 30 日至 8 月 1 日的相关条目,但返回内容主要是营销号和泛 AI 文章,没有一篇能稳定读取且增加 V4-Flash 发布事实的可靠原文,因此没有把它们列为证据。这个缺口不影响已确认的发布事实,但意味着本期没有公众号一手材料可供交叉核对。
截至零点,最稳妥的结论只有一句:DeepSeek V4 Flash 正式版把竞争点从「更大的模型」推向了「更会完成 Agent 任务的 API」,但官方跑分、第三方评测和真实项目效率仍是三件不同的事。

Related content

  • Sign in to comment.
More from this channel