
中国 AI 正在追平哪一层?
Bloomberg称中美AI模型性能差距在6月收窄至6%,但LiveBench的分项结果与中国模型官方自评显示,局部能力接近并不等于全面追平。
6% 说明差距已经进入追赶区,但还不能把局部领先写成全面追平。
作者丨 NeoDrop AI
编辑丨 NeoDrop AI
过去一年,市场习惯用一个问题判断中国 AI:它到底还落后美国多少?
这个问题终于出现了一个足够醒目的数字。
Bloomberg 7 月 23 日援引 Bloomberg Intelligence 的分析称,中国 AI 模型与美国模型的性能差距在 6 月收窄至 6%,低于 5 月的 9%,也是该口径下的历史最低。1
在此前 12 个月里,这一差距平均约为 10% 至 15%。1
同一篇报道还提到,中国模型在 6 月占据 LiveBench 全球大语言模型性能榜的两个席位,智谱 GLM-5.2 曾在 agentic coding,也就是自主编程类别中冲到全球第一。1
Moonshot 的 Kimi 进步,则让 Bloomberg Intelligence 认为,智谱的表现不只是一次偶然突破。1
问题也因此变得更具体:6% 是不是意味着中国 AI 已经实质性追平美国?
答案是,差距正在实质性缩小,但「缩小」和「追平」之间,还隔着模型能力的不同层次。
01|先看数字怎么算
6% 很有冲击力,但它不是一个可以脱离口径单独阅读的成绩单。
Bloomberg Intelligence 没有在公开页面披露这套指标使用了哪些 benchmark、如何归一化不同模型、又怎样计算中美差距。1
所以,6% 不能直接等同于某一张榜单上的总分差。
LiveBench 的设计更接近一把多刃尺:它用定期更新的题目降低训练数据污染风险,覆盖推理、编程、agentic coding、数学、数据分析、语言和指令遵循等 7 个类别,共 23 项客观任务。23
在 6 月 25 日的公开快照里,GPT-5.6 Sol 以 82.4 分排在第一,Kimi K3 以 78.5 分排在第九,GLM-5.2 以 73.2 分排在第二十三。4
按这组数据,Kimi K3 与榜首的原始差距是 3.9 分,GLM-5.2 与榜首的差距则是 9.2 分。4
这与 Bloomberg Intelligence 的 6% 并不矛盾。
它只说明两者可能使用了不同样本、权重和分母。
AI 科技评论注意到,真正需要警惕的不是哪个数字更漂亮,而是不同榜单正在测量不同的「领先」。
02|榜首不等于全能
GLM-5.2 的突破有真实含金量。
智谱官方把它定位为面向长程任务的开放权重模型,提供 100 万 token 上下文窗口,并采用 MIT 许可。5
在 LiveBench 的 Coding 子项里,GLM-5.2 得分 79.7,接近 Claude Opus 4.8 的 79.3。4
但在 Agentic Coding 子项里,GLM-5.2 的得分是 51.9,低于 GPT-5.6 Terra Max 的 68.0,也低于 Kimi K3 的 57.6。4
写出一段可运行的代码,和自主拆解任务、调用工具、修复错误并完成一个工程项目,不是同一件事。
中国模型已经在部分技术切面贴近美国,但最难的地方,仍然是把单点能力变成稳定的长程执行。
这也解释了为什么「GLM-5.2 在 agentic coding 登顶」需要被写上时间和版本限定。
Moonshot 自己给出的表述也很克制。
Kimi K3 的官方技术博客承认,该模型整体性能仍落后于 Claude Fable 5 和 GPT-5.6 Sol,并且在用户体验上仍存在明显差距。6
这是一条重要的反证。
中国模型已经足以进入全球最前排,但中国最领先的模型仍没有把「进入前排」等同于「全面领先」。
03|美国也在移动
追赶者的分数在上涨,领先者也没有停在原地。
这意味着「中国模型距离美国模型还有 6%」不是一条静态跑道。
中国模型每缩短一段距离,美国前沿模型也可能通过下一次更新重新拉开一部分差距。
Stanford HAI 今年的 AI Index 已经给出过更激进的判断:截至 3 月,美国顶级模型只领先中国模型 2.7%,中美模型性能差距「实际上已经闭合」。9
但同一份报告仍然把顶级模型数量、影响力专利和产业化能力拆开讨论。
模型分数可以接近,模型背后的供应链、算力、产品分发和商业回款不会因为一个榜单并列就自动相等。
在 AI 科技评论看来,6% 更像一块正在变薄的冰面。
它证明中国 AI 已经跨过了「只能追随」的阶段,也证明美国的技术优势不再适合被描述成不可触碰的高墙。
但这块冰面还没有厚到可以承受所有能力、所有产品和所有客户的重量。
04|真正的差距在交付
如果只看发布会,中国模型已经获得了足够多的全球存在感。
下一阶段的验证,不能只看谁在某个子榜单上拿过第一。
更该看的是,模型能否在更长的任务里保持稳定,能否以足够低的成本运行,能否接入真实企业工作流,能否让海外用户持续使用。
这些变量决定的不是「模型像不像美国」,而是中国 AI 能不能把能力优势换成真实的市场份额。
一年前,外界讨论的是中国模型能不能追上。
现在,问题已经变成中国模型追上之后,能不能留下来。
所以,回答最初的问题:是,中国 AI 模型正在实质性缩小与美国的性能差距;但还不能据此宣布全面追平。
6% 不是终点线,更像是两边终于进入同一张计分表之后,真正的比赛才开始。
関連コンテンツ
- ログインするとコメントできます。
