字节被曝训练10万亿参数模型,能力账还没交

字节被曝训练10万亿参数模型,能力账还没交

FT 独家、Reuters 全文转述称字节正在训练多达 10 万亿参数的模型;规模可能逼近 Anthropic Mythos,但架构、激活量和独立能力评测尚未公开。

导读

10 万亿参数是字节争取前沿模型规模上限的一张门票,不是已经追平 Mythos 的成绩单。
作者丨 AI 科技评论 编辑丨 AI 科技评论
Kimi K3 刚把 2.8 万亿参数推到台前,FT 就把字节一款未公开模型的量尺写到了 10 万亿。
8 月 7 日,Reuters 在 《ByteDance targets mega AI model that could match Mythos scale, FT reports》 中完整转述 FT 独家:知情人士称,字节正在训练一个多达 10 万亿参数的 AI 模型。1
FT 原生页面可确认标题为《ByteDance targets mega AI model nearing Anthropic's Mythos》,发布时间为 8 月 7 日 12:36;页面正文需要订阅。2
Reuters 全文补齐了数字,也留下了最重要的刹车:该社未能立即独立核实,字节没有回应置评请求。1
这条消息值得读,但 10 万亿目前仍是一项带上限词、匿名信源和未核实声明的报道数字。

01|先读限制语

Reuters 对 FT 报道的完整摘要很短,也很清楚。
字节模型的规模是「多达 10 万亿参数」,超过 Moonshot Kimi K3 的三倍;后者有 2.8 万亿参数。1
模型据称正在预训练,完成这一步通常需要 3 至 6 个月,之后还要微调才能发布。1
「通常」描述的是预训练的一般时长,不是字节承诺的发布日期。
报道没有给出模型名称、架构、激活参数、训练启动日,也没有说明它会开放权重还是只提供 API。
据 Reuters 转述,FT 报道引述的行业估计称,Anthropic 的 Mythos 5 约有 8 万亿参数,Fable 5 约有 5 万亿,因此字节新模型在报道口径下接近 Mythos 的规模。1
这些不是 Anthropic 公布的规格。
Reuters 明确写道,Anthropic 与 OpenAI 不披露 Fable、Mythos、GPT-5.5 等系统的参数量,跨公司直接比较很困难。1
字节对标的是一个业内估出来的天花板,不是一张双方签字确认的规格表。

02|参数榜换了尺

Kimi K3 提供了一个更完整的参照。
Moonshot 官方模型卡写明,Kimi K3 采用混合专家架构,共有 2.8 万亿参数,每个 token 激活约 1040 亿参数,并从 896 个专家中选择 16 个。3
2.8 万亿是整座商场的面积,1040 亿更像每次真正开门营业的楼层。
这个比喻不等于计算公式,却能说明一件事:只看总面积,推不出每位顾客要走多远,也算不出整栋楼的电费。
字节这款模型目前只报了总参数上限,架构和每次激活多少参数都不知道。
因此,10 万亿不能直接换算成训练成本、推理速度、调用价格,更不能换算成能力分数。
Reuters 在 Kimi K3 发布时也提醒,参数只是规模的粗略指标;Omdia 首席分析师 Lian Jye Su 直言,更大的规模并不默认带来最好的性能。4
参数榜越往上走,架构、激活量和推理成本越不能藏在数字背后。

03|字节争什么

AI 科技评论注意到,10 万亿最先改变的不是模型排名,而是字节给自己选的比较对象。
Kimi K3 发布前,美团 LongCat-2.0 与 DeepSeek V4-Pro 以 1.6 万亿总参数领跑中国;Kimi K3 把公开权重模型推到 2.8 万亿。4
在 FT 与 Reuters 的比较语境里,字节若真的把训练规模拉到 10 万亿,参照物就从中国公开模型变成了参数未公开的美国闭源前沿模型。
这是研究目标的抬高,不是能力差距已经归零。
字节今年公开发布 Doubao 2.0 时,把它定位为执行复杂现实任务的「agent 时代」模型,并称多步任务会消耗大量 token。5
但 Reuters 这次没有把 10 万亿模型与 Doubao、Seed 或任何产品线相连。
在 AI 科技评论看来,字节现在争的是进入全球模型规模上限的资格。
这个资格要用数月预训练换来,还要再经过微调、评测和推理部署。
模型越大,发布之前欠下的能力账、成本账和产品账也越厚。

04|先看四张账单

Reuters 原文最该保留的,是这句限制语:
Parameters are often used as a rough measure of scale, though not necessarily capability.
参数量常被用作衡量规模的粗略指标,却不必然代表能力。1
我们会先看架构:10 万亿是稠密模型还是混合专家模型,每次究竟激活多少参数。
再看训练:预训练何时完成,模型名称与发布范围是什么。
第三张账是能力:独立评测能否在推理、编程、智能体和多模态任务上复现前沿表现。
最后才是生意:推理延迟、调用价格和部署条件,能否让大模型走出训练集群。
在这些数字出现前,10 万亿适合写进工程目标,不适合写进冠军名单。
公开信息里,架构、激活参数、发布日期和独立评测仍是空白。
十万亿参数只把字节送上更长的跑道;模型何时跑完、每次调用花多少钱、能力能否复现,才决定它有没有越线。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content