DeepSeek V4 Pro 正式版 0813:静默上线后的海外社媒与跑分全景

DeepSeek V4 Pro 正式版 0813:静默上线后的海外社媒与跑分全景

DeepSeek 把 V4-Pro 版本号改成 0813 即告正式发布:1M 上下文、Agent 跑分大涨,X/Reddit/OpenRouter 反应比官网还快,但视觉能力和独立复测仍缺位。

8 月 12 日,DeepSeek 几乎没发声。没有博客长文,也没有发布会。变化先出现在官方 API 定价页:deepseek-v4-pro 对应的版本号,已经写成 DeepSeek-V4-Pro-08131
这是 4 月预览版之后,旗舰 Pro 线第一次被官方标成正式版本。价格没动,权重变了。海外 AI 圈的反应比官网还快:定价页截图、官方跑分表、OpenRouter 上线通知,几小时内就铺满 X 和 Reddit。

官方写了什么

定价页现在并列两款 V4:DeepSeek-V4-Flash-0731DeepSeek-V4-Pro-0813。两边都写了 1M 上下文、最大输出 384K,支持 thinking / non-thinking,以及 JSON、Tool Calls、Responses API、Anthropic API 兼容。1
Pro 的标价(每百万 tokens)是:
Loading stats card…
Flash 更便宜:Cache Hit $0.0028,Cache Miss $0.14,输出 $0.28。Pro 并发上限写的是 500,Flash 是 2500。页脚还留了一句:DeepSeek 计划在不久后整体上调 API 价格,具体以官方通知为准。1
OpenRouter 同步挂上了 deepseek/deepseek-v4-pro-0813,标注为 GA(正式发布),上下文 1M,列表价 $0.435 / $0.87,发布日期写 Aug 12, 20262
OpenRouter 上的 DeepSeek V4 Pro 0813 卡片,显示 1.05M 上下文与 $0.435/$0.87 价格
OpenRouter 上的 DeepSeek V4 Pro 0813 卡片,显示 1.05M 上下文与 $0.435/$0.87 价格
OpenRouter 模型卡截图:GA、1M 上下文、列表价 $0.435 / $0.87
7 月 31 日 Flash 转正时,官方自己说过:当天升级只动 Flash API,Pro API 与 App/Web 暂时不变,Pro 正式版「coming ASAP」。3
Loading content card…
12 天后,0813 就以「改定价页版本号」的方式落地了。

官方跑分表:Agent 项抬得最狠

随正式版一起流传的,是一张 DeepSeek 自己放出的 Agent 相关对比表。表里把 V4-Pro-0813V4-Flash-0731、两边的 Preview,以及 GLM-5.2、Kimi-K3、Opus-4.8、Fable 5 放在同一格里。
DeepSeek 官方 Agent 评测对比表,含 V4-Pro-0813 与 Kimi-K3、Opus、Fable 5
DeepSeek 官方 Agent 评测对比表,含 V4-Pro-0813 与 Kimi-K3、Opus、Fable 5
DeepSeek 放出的 Agent 相关自测对照表(含 Kimi-K3 / Opus / Fable 5)
相对 4 月的 V4-Pro-Preview,官方数字里几项跳得最大:
评测Preview0813变化
Terminal Bench 2.172.187.9+15.8
Cybergym52.783.3+30.6
DeepSWE12.862.7+49.9
NL2Repo38.561.5+23.0
Toolathlon-Verified55.974.1+18.2
和闭源前沿比,这张表的叙事很克制:多数项仍略低于 Fable 5Opus-4.8,但 Cybergym(83.3)和 AutomationBench(31.8)被圈成领先;Terminal Bench 2.1 的 87.9 贴着 Fable 5 的 88.0。和 Kimi-K3 比,大约一半项目仍落后——这点海外讨论里反复出现。
Decrypt 的报道强调了两个限制:分数由 DeepSeek 自测,部分 harness 尚未完全公开;DSBench-FullStack / DSBench-Hard 还是内部集,外面没法直接对表。截至发稿,独立第三方对 0813 的系统复测仍很少4
价格对照更直观。Claude Fable 5 公开价大约是输入 $10 / 输出 $50 每百万 tokens;DeepSeek V4 Pro 是 $0.435 / $0.87。Decrypt 按混合单价粗算,大约差 40 倍以上;再算上 Fable 更长的思考轨迹,单任务成本差距还会再拉开。4

X 上:先截图,再吵「能不能当真」

最早一批高赞帖,几乎都在做同一件事:证明「页上真的改了」。
@AndrewCurran_ 直接贴出定价页数字:Cache Hit $0.003625,输出 $0.875
Loading content card…
@zephyr_z9 盯住 Cybergym 的 83.3,一句「Dayum」带了四百多赞。6
Loading content card…
@scaling01 把完整跑分图甩出来,标题写得很直:
DeepSeek-V4-Pro Benchmarks still behind Kimi-K3 in ~half of them
这条拿到四百多赞,评论区基本围着「是不是还是 K3 更稳」打转。7
Loading content card…
@ChrisGPT 把官方增幅翻译成开发者能听懂的句子:Terminal-Bench 2.1 从 72.1% 到 87.9%,Cybergym 52.7% 到 83.3%,DeepSWE 12.8% 到 62.7%;同时抱怨「每家公司报的基准都不一样,最后还得看综合榜」。8
Loading content card…
工具链反应最快。开源 coding agent OpenCode 发推:Flash 火了一周,最新 V4 Pro 已进 OpenCode Go——这条超过 4200 赞,是当天传播最广的产品接入帖。9
Loading content card…
OpenRouter 官方账号同步宣布上线,并复述官方相对 Preview 的 agent 增幅:DeepSWE +49.9、CyberGym +30.6、NL2Repo +23.0、Terminal Bench 2.1 +15.810
Loading content card…
定价叙事也很统一。@MrAhmadAwais 写 Command Code 已接入,并列了一串「便宜多少倍」:比 Fable 便宜约 58 倍,比 GPT 5.6 Sol 约 35 倍,比 Opus 5 约 29 倍,比 Sonnet 5 约 12 倍——这是博主自己的换算,不是官方对照表。11
Loading content card…
编码助手 Cline 的说法更狠:静默发布、Terminal Bench 比 Preview 高 15.8 个点、「Fable 5 级表现、成本大约便宜 57 倍」,并给出 1.6T 总参、49B 激活、1M 上下文 的规格描述。12
Loading content card…
量化研究者 @Tim_Dettmers 引用这条后补了一句落地想象:即将放出新的量化推理框架,目标是在单卡 B300 上跑到约 50 tok/s 的可用质量——「Local Fable」。13
中文圈也有降温声。@edward40e 写:对 0813 期望不低,实测仍略逊 Luna MX;反倒觉得隔壁 Grok 4.6 在推理步数明显减少后仍能稳住水准,更值得追问。14

Reddit:先看价,再问「有没有视觉」

r/DeepSeek 当天至少两条主帖在发酵:
定价帖下面,最高赞一类评论几乎同款:
China won AI race... cheaper, faster and better
另一条高频吐槽更具体:还是没有 vision。「I can't believe still no vision」「still blind」反复出现。有人直接丢 OpenRouter 链接当可用性证明。
跑分帖的情绪是「便宜到离谱」叠加「价格会不会马上涨」。置顶附近有人问 Have they jacked up the price yet?,回复是 not yet;也有人提醒官方已经预告过整体涨价。@kappaderickz 那句最像社群金句:
Near frontier intelligence for pennies
Reddit 上流传的 V4 Pro 0813 与 Opus / Fable 对比跑分图
Reddit 上流传的 V4 Pro 0813 与 Opus / Fable 对比跑分图
Reddit 上流传的 0813 vs Opus / Fable 跑分图
r/LocalLLaMA 也冲进一条跑分贴,评论过百,但版主以「低质量 benchmark、缺分析」为由删了主帖——本身就说明社区对「只甩官方表」已经过敏。删帖讨论里仍有人追问:为什么 Flash 没视觉之后,Pro 还是不带视觉;以及「硬件成本和速度大概对 K3 是什么关系」。
Reddit 讨论里流传的价格页相关截图
Reddit 讨论里流传的价格页相关截图
社群讨论里同步流传的价格页相关截图

YouTube:大量实测还是 4 月预览版的账

检索当下能找到的高播放评测,时间轴要分清。WorldofAI 的《Deepseek v4: Best Opensource Model Ever?》播放约 4.6 万,结论大致是:1M 上下文和成本很猛,推理/知识强,创意和成品打磨偏弱,benchmark 不能完全代表真用。15
Loading content card…
AICodeKing 把 GPT-5.5、DeepSeek V4、Opus 4.7 丢进自建 KingBench 2.0(电梯模拟、Three.js、折叠桌等前端/3D 题),整体观感是 Opus 在复杂前端更稳,DeepSeek 胜在上下文和激进定价。16
Loading content card…
Superbash 的《DeepSeek v4 Pro Review (Real World Tests)》和 Venelin Valkov 的 OpenCode/前端实况,也是同一批预览窗口的产物。17
这些片子能当「V4 Pro 长什么样」的底座,不能直接当成 0813 的复测。正式版 8 月 12 日才改版本号,长视频作者通常还要一两天才会重跑同一套题。

现在能下的判断

把官方页、自测表和海外社媒叠在一起,画面其实很清楚:
  1. 正式版已上线,证据是定价页版本号 + OpenRouter GA 卡,不是博客新闻稿。
  2. 官方主打 Agent/终端/代码仓库类增益,DeepSWE、Cybergym、Terminal Bench 的跳变是传播核心。
  3. 对 Fable / Opus 仍多半略逊,对 Kimi-K3 互有胜负;「全面超车」不是今天这张表能支撑的说法。
  4. 价格才是真正的杀伤半径。工具链(OpenCode、Cline、Command Code、OpenRouter)几乎在同一天把模型接进默认可用列表。
  5. 两个硬缺口还在:无视觉能力;独立第三方对 0813 的复测与开放权重本地跑通报告,都还在路上。官方还预告了未来涨价。
如果你在等「能不能今天就换成默认 coding 模型」:API 和聚合路由已经能点;如果你在等「本地单卡复现 Fable 级」或「带视觉的一体机」,社媒上的兴奋还没变成可核验的交付清单。
接下来 48–72 小时,真正有信息量的信号大概只有三类:独立榜(LMSYS / Artificial Analysis 一类)有没有 0813 分项、有没有人公开权重与量化脚本、以及涨价通知会不会比复测更早到来。
知乎AI热点深度追踪日报

知乎AI热点深度追踪日报

每日扫描知乎热榜,筛选AI前沿科技相关的真实话题,结合国内外社交平台深挖背景与预测,按热度重要性排名输出

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel