
知乎第6名:韩国700B模型接连开源,真的超过DeepSeek了吗?
核对 LG、SK 电讯与 Upstage 的模型规格、许可证和自报评测,解释为什么「超过 DeepSeek」仍需统一外部复测,并补入知乎高赞回答对开源成果被本地化包装的讽刺。
截至 8 月 4 日 0 点,本轮知乎官方热榜接口返回 30 条。AI 相关信号里,排名最高的是第 6 名:问题标题把 LG、SK 电讯、Upstage 等韩国公司的新模型放在一起,追问它们是否已经超过 DeepSeek,榜单字段显示为 220 万热度。问题本身是真实的热榜条目,但「超过」不是一个已经被统一测试证明的结论。知乎问题页 1
先看清楚:韩国确实连续放出了几款大模型
这条热搜并非凭空出现。7 月下旬到 31 日,韩国几家公司的开放权重模型接连进入 Hugging Face,但它们的模型规模、许可证、评测集和可用方式并不相同。把它们都概括成「打败 DeepSeek」,会把几个不同层次的事实压成一句宣传语。
| 模型 | 已公开的规模与上下文 | 许可证或开放方式 | 目前能确认的比较信息 |
|---|---|---|---|
| LG K-EXAONE 2.0 | 750B 总参数、37B 激活参数,262,144 tokens;支持 10 种语言。2 | Apache 2.0,可商用。2 | LG 报告 24 项评测平均 70.1;《韩国时报》转述其在特定长上下文、工具使用和指令遵循项目上与 GLM-5.1、DeepSeek V4 Pro Max、Qwen3.5 比较。3 |
| SK 电讯 A.X K2 | 688B 总参数、33B 每 token 激活参数,256K 上下文;文本模型。4 | Apache 2.0 开放权重。4 | SKT 称其在 14 项基准上的平均表现比 A.X K1 高 32.2 个百分点,在长文本理解和 Agent 相关评测上高 83.9 个百分点;首发报道还把它与 Qwen3.5-397B、DeepSeek-V4-Flash 放在数学和韩语评测中比较。56 |
| Upstage Solar Open 2 | 250B 总参数、15B 每 token 激活参数,1M 上下文。7 | Upstage Solar License,不是 Apache 2.0;衍生模型须保留 Solar 名称并注明 Built with Solar。7 | Upstage 技术报告称其在 Ko-GDPval 上可与 1.6T 的 DeepSeek-V4-Pro 竞争;这是论文作者的评测结论,不能直接等同于所有任务上的胜出。8 |
三个数字容易被误读。750B、688B 和 250B 是总参数,不是每次生成都会完整激活的参数;MoE 模型的激活参数较低,但模型权重、显存、并行部署和推理带宽仍然是现实成本。A.X K2 模型卡还明确写着,它主要验证了英语和韩语场景,评测多为单轮,且不适合未经额外验证的医疗、金融、就业、法律或安全关键决策。4
「超过 DeepSeek」到底缺哪一步?
缺的不是更多宣传数字,而是同一套外部条件下的可复现实测。LG 的 24 项表、SKT 的 14 项表和 Upstage 的技术报告,比较对象、任务定义、提示词、推理预算和是否使用工具都不完全相同。它们可以证明发布方在特定项目上取得了特定分数,不能自动推出一个跨模型总榜。
这也是为什么「国产」「韩国」「开源」和「更强」必须拆开写:
- 发布事实已经成立。 LG 和 SKT 的权重都能在 Hugging Face 找到,LG 的模型卡更新时间为 7 月 31 日;两家都采用了 Apache 2.0。24
- 发布方自报成绩成立,但只在各自评测边界内成立。 《韩国时报》引用 LG 的说法,称模型在 24 项评测平均 70.1;SKT 官方稿件则给出相对于 A.X K1 的提升幅度。两者都不是第三方在同一套任务上重新跑出的总分。35
- 工程可用性仍要单独验收。 开放权重降低了许可门槛,却没有消除部署门槛;模型是否能在目标硬件上稳定运行,是否有成熟量化版本,中文任务的效果和延迟如何,都不能从参数规模推出。
8 月 2 日发布的一条 YouTube 核查视频做了一个有用的降温:它逐项数 LG 模型卡的 24 项对比,指出 K-EXAONE 2.0 在其中排名第一的项目是少数几项,且「平均 70.1」无法仅凭公开表格完全复算。这个视频是独立作者对公开资料的分析,不是第三方基准报告;它的价值在于提醒读者先看评测表,而不是把标题里的「超越」当成总榜结论。
Loading content card…
X 上的讨论也出现了同一条分界线:一条帖子把 LG 和 SKT 两个 700B 级模型的 Apache 2.0 开放权重视为模型服务故障时的替代选项;另一条较有传播力的帖子则把 A.X K2 的 688B、33B 激活参数和数学、韩语评测成绩概括为「加入 AI 竞赛」。这些是观察者的判断,不是统一跑分。910
这轮竞争真正争的是什么
LG 和 SKT 的动作都有明显的主权 AI 背景。LG 说 K-EXAONE 2.0 用于韩国国家 AI 基础模型项目;SKT 则已经把 A.X K2 的应用场景写到制造、国防、生物医药和企业工具中。SKT 官方新闻稿提到 KG Steel、KONEC、韩国国防部和 SK Biopharmaceuticals 等合作方向,但这些是部署和试点叙述,不等于模型已经在这些场景完成大规模生产验证。35
这比一次榜单胜负更值得看。国家项目要的不是一张漂亮的分数表,而是能否把模型权重、语言能力、行业数据、算力部署和采购关系连起来。对企业用户而言,Apache 2.0 让 LG 和 SKT 的权重更容易进入自托管评估;但真正的采购比较仍要问四个问题:
- 在中文、韩文、英文以及目标行业语料上,质量差距是否稳定,而不是只在一两个 benchmark 上出现?
- 量化、推理框架和显存需求是否公开到足以复现?
- 模型卡中的安全限制,能否被企业的权限、审计和回滚机制接住?
- 试点是否转成了可观察的延迟、成本、成功率和用户留存,而不只是发布会案例?
知乎讨论:开源被包装成「自研」的争议,比榜单更吵
问题页上传播力最强的一条,是靓女杨东东的回答,页面显示约 1240 赞。它几乎不讨论哪张评测表更高,而是用一组「各地风味自研大模型」的类比,把最近的开源与闭源、贡献与包装争议讲得直白:DeepSeek 一类中国开源模型像基础食材,其他地区再在此之上做本地化微调、蒸馏或对齐,于是叙事里就出现「半岛风味」「南亚风味」「东南亚风味」一类自研包装。幽默点在于:真正刺痛舆论的,往往不是韩国模型能不能做本地化,而是开放权重成果被二次包装后,市场话术容易把「站在开源肩膀上继续做」说成「完全自研并全面超越」。11
这条梗和前面的技术核对并不打架。LG、SKT、Upstage 的模型卡、许可证和技术报告仍然要逐项看:训练与后训练方法、数据边界、是否可商用、以及有没有统一外部复测。梗图解决的是叙事问题,不是参数表;它提醒读者,在「超过 DeepSeek」的标题之外,还要问一句——宣传里的「自研」指的是从零训练,还是基于开放权重做本地适配。
同题下还有几条可打开的代表性观点(接口返回的排序字段偏更新时间,不能据此冒充实时点赞前三):
- Kyanite 的回答把质疑集中在「赢学」与事实之间的差距:声称超过 DeepSeek,并不等于已经完成第三方验证,不能只看 PPT;后半部分关于入口可用性是作者判断,不能当作独立证据。12
- 啦啦啦的回答偏开放:多家公司一起发开放模型,至少让开发者多了可比较、可借鉴的对象;它没有给出性能证明,但抓住了开放权重的实用价值。13
- 大唐吴王钱巨美的回答怀疑所谓超越只是把既有开源模型接到本地前端。这是讨论区里的怀疑,不是证据;模型卡显示 A.X K2 和 K-EXAONE 2.0 都有自己的架构、权重和技术说明,这条推测不能直接当事实。2414
知乎讨论里最有用的部分,不是站队嘲讽,而是把「发布了什么」「测了什么」「谁独立复测过」「能不能部署」「宣传里的自研到底指什么」拆开。前两项已有公开材料,后三项仍没有被这轮热搜本身回答。
未来一周该看什么
我会把后续信号按重要性排成四项:
- 同条件复测。 看是否出现使用相同提示词、相同推理预算和相同工具权限的外部评测,而不是继续增加厂商自报榜单。
- 可部署性证据。 看量化权重、推理框架、显存配置、吞吐和延迟是否被第三方复现;总参数和激活参数都不能代替这组数据。
- 语言与行业迁移。 A.X K2 模型卡自己承认验证重点在英语和韩语;下一步要看中文、日文以及制造、国防、生物等场景是否有可重复的任务结果。4
- 从试点到采购。 LG 和 SKT 都把国家项目或行业落地写进发布叙事,真正有分量的信号将是持续运行的产品、成本和效果数据,而不是一次发布会排名。35
今日判断
韩国模型这次不是假新闻:LG、SK 电讯和 Upstage 都确实公开了模型或技术报告,且至少两款 700B 级模型采用了 Apache 2.0。真正尚未被证明的,是它们能否在统一、可复现的外部测试中全面超过 DeepSeek。
更准确的说法是:韩国正在把「主权模型」从政策口号推向开放权重、行业试点和可部署性竞争;至于谁在实际任务上更强,要等同条件复测和真实生产数据来回答。
References
- 1知乎热榜问题
zhihu.com
- 2K-EXAONE 2.0 模型卡
huggingface.co
- 3The Korea Times:K-EXAONE 2.0 发布报道
koreatimes.co.kr
- 4A.X K2 模型卡
huggingface.co
- 5SK Telecom 官方新闻稿
news.sktelecom.com
- 6Seoul Economic Daily:A.X K2 报道
en.sedaily.com
- 7Solar Open 2 模型卡
huggingface.co
- 8Solar Open 2 Technical Report
arxiv.org
- 9X 上关于两款韩国开放权重模型的讨论
x.com
- 10X 上关于 A.X K2 的评测讨论
x.com
- 11知乎回答:靓女杨东东
zhihu.com
- 12知乎回答:Kyanite
zhihu.com
- 13知乎回答:啦啦啦
zhihu.com
- 14知乎回答:大唐吴王钱巨美
zhihu.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- 知乎第7名:OpenAI 说下一代 Harness 不止一台笔记本,Codex 真要离开 PC 了吗?
- 知乎第1名:美国拟禁中国新型光模块,京东AI头盔能否把安全交给语音?
- 知乎第3名:DeepSeek V4 Flash 单日 8 万亿 Token,开发者是在用脚投票,还是在薅免费额度?
- 知乎第12名:AI短剧上半年冲到22万部,为何破亿率只有0.47%
- 8月3日中午知乎热榜:Astra十项数学进展,邓煜团队的方程离 Fluent 还有多远
- 8月3日零点知乎热榜:废弃矿井给小区供冷,零跑单月交付破10万
- 8月2日中午知乎热榜:AI抢显存推高装机成本,GCC为何给生成式代码划线
- 8月2日零点知乎热榜:第三方售卡收紧、寒武纪股权激励与「白海豚」路径未定
