
10万亿参数,字节把大模型竞赛推向一张更大的账单
FT称字节跳动正在训练最多10万亿参数的模型;文章拆开规模估计、Kimi K3与Anthropic Mythos的比较,以及这仍只是早期训练计划的证据边界。
作者丨 AI 科技评论
编辑丨 AI 科技评论
导读
Financial Times 8 月 7 日发表一篇关于字节跳动模型计划的报道,标题是 《ByteDance targets mega AI model nearing Anthropic’s Mythos》。
FT 副标题给出的信息更具体:TikTok 母公司正在训练一款规模约为 Moonshot Kimi K3 三倍的模型。1
Reuters 随后对同一报道作了公开转述:字节跳动训练中的模型参数量最多可能达到 10 万亿,接近 Anthropic 最前沿的 Mythos;Kimi K3 的参数量为 2.8 万亿。2
最重要的边界是:这是一项处于早期训练阶段的模型计划,不是一款已经完成、发布或被证明更强的产品。
FT 原文正文目前需要订阅,本文只使用 FT 可见的标题、副标题和时间信息,以及 Reuters 对同一报道的公开转述;没有把无法读取的段落补写成事实。
01|10 万亿先是目标
Reuters 的表述是,字节跳动正在训练一款可能接近 Mythos 规模的 AI 模型,消息来自 FT 援引的知情人士。2
Reuters 公开转述的完整版本进一步写明,模型参数量「as many as 10 trillion」,也就是最多 10 万亿。3
「as many as」不是已经测得的最终数字,而是上限式说法。
报道还说,模型目前正在进行预训练,通常需要三到六个月,之后才会进入微调和发布环节。3
从预训练开始,到模型真的可用,中间隔着一整段工程周期。
所以,今天能确认的是字节跳动正在推进一个极大规模的训练计划,不能确认的是最终参数量、完成时间和是否一定会发布。
02|三倍不是三倍能力
按报道给出的参数量直接相除,10 万亿相对于 Kimi K3 的 2.8 万亿,约为 3.6 倍;Reuters 因此写成「more than three times」。3
参数是模型从数据中学习的数值设置,常被用来粗略描述规模,但它不等于能力。3
模型会不会更聪明,还要看数据、训练方法、推理效率、产品调校和实际测试。
10 万亿这个数字首先说明字节想把机器做大,不能直接说明它已经把机器做得更好。
这也是大模型新闻里最容易被跳过的一层:规模可以被报道,能力需要评测;参数可以被比较,用户结果不能靠除法得出。
AI 科技评论注意到,Reuters 还提醒,Anthropic 和 OpenAI 并不公开披露 Mythos、Fable 或 GPT-5.5 等系统的参数量,所谓中美模型规模对照,很多时候只能依靠行业估算。3
03|Mythos 不是公开账本
Reuters 转述 FT 的说法称,行业估计 Anthropic 最先进的 Mythos 5 约有 8 万亿参数,Fable 5 约有 5 万亿参数。3
这两个数字来自行业估计,不是 Anthropic 发布的官方参数表。
因此,「接近 Mythos」的含义是规模接近,而不是能力已经接近。
如果 10 万亿最终落地,字节跳动会把中国大模型公司的规模上限推到一个新的区间。
但这仍然是一张纸面上的全球坐标图:美国公司隐藏参数,中国公司披露或被消息人士描述的参数也可能变化,双方并没有一份统一的公开测试账本。
在 AI 科技评论看来,这条新闻真正改变的不是排行榜,而是比较对象。
中国模型过去常被放在「能否追上」的框架里讨论,这次消息把问题换成了「能否在相近的训练规模上持续推进」。
04|训练账单还没公开
可访问的报道没有披露这款模型使用什么芯片、多少服务器、多少电力或多少训练预算。
Reuters 也明确写道,它无法立即独立核实 FT 的报道;字节跳动没有立即回应置评请求。2
这两句放在一起,决定了今天的证据等级。
我们有一个来自知情人士的规模线索,有 Reuters 对线索的转述,但没有字节跳动公开确认,也没有训练集群和成本文件。
模型参数量是新闻的入口,不是训练能力的证明。
10 万亿参数意味着更大的工程赌注,这是基于模型规模的行业推断,不是 FT 或 Reuters 已经披露的一张算力清单。
05|字节在和谁赛跑
Reuters 把这条消息放在中国公司加快模型发布、追赶全球 AI 竞赛的背景下,同时指出,行业还在努力让更强的模型不至于变得过于昂贵。3
这是一种很具体的竞争压力:模型要更大,发布速度要更快,运行成本却不能同步失控。
字节跳动对标的也不再只是中国同业的下一代模型。
它的参照物包括 Moonshot 的 Kimi K3,也包括 Anthropic 的 Mythos 和 Fable,以及 OpenAI 的 GPT-5.5。3
这不意味着这些模型处在同一条公开赛道上。
Anthropic 和 OpenAI 的参数量大多没有公开,字节跳动的最终模型也尚未完成;现在能比较的,只有报道中的规模估计和公司的训练动作。
下一步真正有信息量的,不是再报一次「10 万亿」,而是看字节是否公布模型、基准成绩、训练周期和部署成本。
06|原报道里的三句话
「ByteDance targets mega AI model nearing Anthropic’s Mythos」——Financial Times 标题。1
「TikTok owner training a model three times larger than Moonshot’s Kimi K3」——Financial Times 副标题。1
「Reuters could not immediately verify the report.」——Reuters 对这条 FT 报道的证据提示。2
第三句话不能被删掉。
它提醒我们,10 万亿参数目前是字节跳动训练计划的一条高价值线索,距离一款被公开验证的模型,还有预训练、微调、发布和评测四道门。
如果这台机器真的开始转动,下一轮大模型竞争比的就不只是模型会不会回答,而是谁能先把十万亿个参数训练成一个能被市场使用的产品。
References
- 1
- 2
- 3

海外媒体中国AI独家追踪
追踪海外主流财经科技媒体对中国AI领域的独家报道,重磅独家单独成篇深度解读,以文章形式呈现。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.