
知乎热榜第23名:DeepSeek V4 预览已上线,「满血 GA」灰度仍待证实
DeepSeek 官方公众号与 API 文档已确认 V4 Pro/Flash 预览版、1M 上下文、价格与旧模型迁移规则;但「满血 GA」灰度、性能接近 Opus 4.8 及全面超过 Kimi K3,仍缺少同等级的独立验证。
先给结论
知乎 7 月 21 日 12:00 快照中,第 23 名问题「DeepSeek V4 开放灰度测试,你认为能超越 Kimi K3 吗?两个大模型各有哪些优劣?」有 182 万热度、16 个回答。1
这条热搜把三件不同的事混成了一件事:DeepSeek V4 预览版是否已公开、所谓「满血 GA」是否已开始灰度、以及它是否已经在能力上超过 Kimi K3。到目前能闭环的判断是:V4 预览版和 API 已有官方确认;「GA 灰度」有开发者与媒体信号,但没有同等级的正式确认;超过 Kimi K3 则更没有独立、同口径的评测证据。
对开发者而言,眼下最实用的变化不是追逐「谁赢了」的截图,而是官方 API 已经出现新的模型 ID、1M 上下文和明确价格。对普通读者而言,DeepSeek V4 的真正看点仍是长上下文和 Agent 工作流的成本边界,而不是尚未复现的「接近 Opus 4.8」口号。
已确认:V4 预览版确实公开了
「深度求索」公众号原文写明,DeepSeek-V4 预览版「正式上线并同步开源」,用户可以在官网或 App 使用,API 也同步支持
deepseek-v4-pro 和 deepseek-v4-flash。原文还明确给出 1M 上下文、思考与非思考模式,以及 Hugging Face 和 ModelScope 的开源入口。2这不是「有人看到内部模型字符串」级别的传言,而是产品入口、模型名称和调用方式都已经公开。对应的官方 API 文档目前列出:
| 项目 | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| 上下文长度 | 1M | 1M |
| 缓存命中输入 / 百万 token | $0.0028 | $0.003625 |
| 缓存未命中输入 / 百万 token | $0.14 | $0.435 |
| 输出 / 百万 token | $0.28 | $0.87 |
| 并发上限 | 2500 | 500 |
价格和并发数据来自 DeepSeek 官方定价页;页面同时说明产品价格可能调整,因此这张表只能代表本轮核验时的公开值。3
官方技术报告进一步把「预览版」的技术边界说得更清楚:V4-Pro 是 1.6T 参数、约 49B 激活参数的 MoE 模型,V4-Flash 是 284B 参数、约 13B 激活参数;两者都支持 1M token 上下文,预训练数据超过 32T token。报告提交于 2026 年 4 月 26 日,里面的基准结果属于发布方自报结果,不等于已经完成第三方复现。4
未确认:所谓「满血 GA 灰度」是什么
7 月 20 日 15:24 发布的 TechWeb 报道称,部分开发者可能已经拿到 V4 正式版灰度权限,并转述了 V4 Pro、V4 Flash、峰谷计费以及旧模型名停用等信息。但报道结尾也明确写着:截至发稿,DeepSeek 官方尚未发布正式公告,最终发布时间和细节仍待确认。5
X 上传播最广的一条相关帖子来自开发者 Pankaj Kumar。他在 7 月 19 日凌晨的帖子中写的是「Coming Tomorrow」,并把「整体接近 Opus 4.8、编码接近 GPT-5.6 Sol、Agent 和 3D/SVG 更强、但总体可能不如 Kimi K3」都写成早期印象或推测,而不是可复现的评测报告。6
正在加载内容卡片…
YouTube 上同一波讨论也保留了这个边界。视频「DeepSeek V4 Pro GA Leaks Just Destroyed Claude Fable?」的字幕反复强调:没有官方 GA 公告,相关内容来自 X 帖文、截图和少量灰度体验,不能仅凭 HTML 游戏或演示图判断模型已经「毁掉」闭源模型。7
因此,「灰度」目前可以作为一个值得跟踪的行业信号,但不能改写成「正式版已经全面上线」。本轮真正的官方变化是预览版 API 已公开;至于 GA 版本是否存在更大的后训练升级、是否已经对部分账号放量,仍要等官方公告、变更记录或可复现实测。
和 Kimi K3 比,先看证据口径
Kimi 官方页面显示,Kimi K3 的完整模型权重计划在 7 月 27 日发布。也就是说,在权重和完整技术报告尚未全部落地前,拿 V4 的官方技术报告、Kimi 的公开博客、个人截图和不同榜单混排,无法得出稳定的「谁更强」结论。8
| 比较项 | DeepSeek V4 | Kimi K3 |
|---|---|---|
| 当前能确认的状态 | V4 Pro / Flash 预览版已公开,API 已可按官方模型名调用 | 官方博客已发布,完整权重计划 7 月 27 日发布 |
| 上下文 | 官方标称 1M | 官方页面强调长上下文与开放权重路线,但完整技术报告尚未到计划日期 |
| 价格 | V4 Flash 输出 $0.28 / 百万 token,V4 Pro 输出 $0.87 / 百万 token | 本文不把第三方转述价格当作官方定价结论 |
| 能力结论 | 官方报告给出自测结果;独立复现仍待补齐 | 公开讨论很多,但应等待权重和同口径测试 |
V4 的竞争点已经比「参数更大」更具体:一是 1M 上下文是否能在长文档、代码仓库和多轮 Agent 任务中稳定工作;二是缓存命中价格能否把高频调用成本压低;三是
Flash 与 Pro 在高难度任务上的差距是否值得更高并发成本。官方文章称 Pro 在 Agentic Coding 和部分推理评测上表现突出,Flash 在简单任务上接近 Pro,但这些仍是发布方口径,需要第三方用同一提示词、同一工具链和同一评测版本复核。2对开发者:7 月 24 日前要做的不是换榜单
官方文档说明,旧模型名
deepseek-chat 和 deepseek-reasoner 将在 2026 年 7 月 24 日 23:59(UTC+8) 弃用;在过渡期内,它们分别对应 V4 Flash 的非思考模式与思考模式。3这带来三个直接检查项:
- 把代码里的旧模型名、模型白名单和计费统计单独搜一遍,确认是否显式写死了
deepseek-chat或deepseek-reasoner。 - 用
deepseek-v4-flash和deepseek-v4-pro分别跑一组真实任务,记录是否依赖思考模式、工具调用、JSON 输出和长上下文,而不是只测一个聊天问题。 - 对高峰期任务重新计算成本。官方当前公开的是统一单价,文章中流传的「峰谷翻倍」仍来自媒体转述,不能在预算表里当成已确认规则;真正计费以 API 定价页为准。
知乎高赞回答:前三排序本轮无法核验
热榜快照显示该问题有 16 个回答,但知乎问题页和直达答案页在本轮访问时都触发了安全验证,无法读取实时赞同数与完整排序。公开搜索索引只暴露出一条具体答案链接,片段中答主「恋猫」认为:V4 Pro 的规模即使小于 Kimi K3,也可能凭后训练追平部分闭源模型;但要直接超过 Kimi K3 仍有难度,真正值得观察的是官方 Agent harness 和价格。9
这段内容只能作为「公开可见片段」摘要,不能证明它是实时点赞最高的第 1 条,更不能据此补齐点赞第 2、第 3 条。本期不把受限数据包装成「高赞前三」。
接下来观察什么
未来 24 至 48 小时,最有信息量的新增证据按优先级排列是:
- DeepSeek 官方公告或文档变更记录是否把「预览版」明确升级为 GA,并说明灰度范围与发布时间。
- V4 Pro / Flash 是否出现可复现的独立测试,尤其是长上下文检索、工具调用、代码修复和 Agent 多轮成功率。
- 7 月 24 日弃用旧模型名后,真实调用是否出现兼容性、思考模式默认值或限流变化。
- Kimi K3 权重与技术报告在 7 月 27 日落地后,能否在同一套任务、同一套工具调用规则下和 V4 做公平比较。
截至目前,最稳妥的判断不是「DeepSeek V4 已经击败 Kimi K3」,而是:DeepSeek 已把 V4 从预览论文推进到了公开 API 产品;下一场竞争将从发布传言转向上下文效率、Agent 稳定性和真实调用成本。
来源
相似内容
- 登录后可发表评论。
More from this channel›
- 知乎热榜第20名:《阴兵》把AI短片推到电影门槛了吗?
- 王祖贤授权 AI 肖像给游戏:已确认的是一次合作,未确认的是合同边界
- 知乎热榜7月22日午报:AI识菌误判与Hugging Face事件,两个高风险边界
- 知乎热榜线索:GenCeption把视频生成模型改成视觉感知器,数据效率仍待复核
- 知乎热榜第1名:雅可比猜想出现三维反例,AI「自主证伪」仍未被证实
- 知乎科技热榜 7 月 20 日午报:美国反数据中心运动扩散,「出售潮」证据够不够?
- 知乎科技热榜 7 月 20 日 0 点追踪:Qwen3.8 先行上线,Kimi 事件转向开放权重之争
- 知乎科技热榜 7 月 19 日午报:科研工厂跑完 135 题,安卓四厂统一标准能落地吗?
