晚点聊 179 速读:蒸馏不是抄答案,模型竞争转向数据、组织与成本

晚点聊 179 速读:蒸馏不是抄答案,模型竞争转向数据、组织与成本

《晚点聊》179 解释蒸馏如何从模型压缩手段变成前沿模型竞争中的数据、组织与成本问题,并梳理它的技术边界、合规争议和商业影响。

这是一场由《晚点 LatePost》编辑部完成的技术观点对谈:主播高洪浩与科技报道负责人程曼祺,试着解释一个业内都在关注、却很少有人愿意公开谈的词——AI 蒸馏。节目从「学生模型是不是在抄教师模型的答案」讲起,走到智能体轨迹、字节为什么选择不蒸馏、蒸馏的合规边界,以及更便宜的智能会怎样改变前沿模型的商业逻辑。节目于 2026 年 8 月 17 日 06:45(北京时间)发布,时长约 49 分 34 秒;两位主播也反复提醒,内容主要来自他们与多家 AI 实验室从业者的交流和公开资料,而不是某位亲自实施蒸馏的嘉宾。1

先把蒸馏讲清楚:学生学的是行为,不是一张答案

节目里最先要纠正的,是「蒸馏就是抄答案」这个过于省事的说法。一个典型过程是:团队先准备一批问题,把问题交给更强的 teacher model(教师模型),得到回答、推理过程或完整任务轨迹,再用这些数据训练自己的 student model(学生模型),让学生的输出行为逐步接近教师。这里真正被学习的是一组可泛化的模式,不是一道题的答案原封不动地搬过去。1
这也是为什么蒸馏需要算力、数据和训练方法。学生模型要经过后训练等环节,才能把教师的行为吸收进自己的参数;问题质量、回答筛选、训练配比和评测方法都会影响结果。把更强模型的输出拿来做评估、奖励信号或强化学习数据,也可能帮助训练,但节目强调:只要使用了强模型输出,并不自动等于「蒸馏」。技术上要看学生是不是在逼近教师的输出或行为,规则上则还要另看服务条款与数据来源。1

为什么 2026 年蒸馏突然变成前沿竞争

蒸馏这项技术本身并不新。节目把它在最近两年升温的原因归结为两个变化。第一个变化来自推理模型:模型在回答问题时可以投入更多 inference-time compute,也就是在使用阶段为一道题生成更长、更细的推理过程。推理过程越丰富,教师模型能提供的训练原料就越多;蒸馏的投入回报因此提高。节目把 OpenAI o1 系列作为这一范式变化的例子,并提到 DeepSeek-R1 进一步把这种讨论推向了模型开源竞争。1
第二个变化来自蒸馏目标的变化。早期更常见的目标是「压缩」:把大模型的能力搬到更小、更快、更便宜的模型里,方便手机、汽车和未来机器人等算力受限的场景使用。到了今天,行业讨论的重点变成「为了变强」:团队希望借助已经领先的模型,把自己的模型推到更高的能力区间。压缩和变强并不是两个完全分开的目标,小模型能力上升本来就是一种变强;真正改变的是团队把蒸馏放在模型竞争中的位置。1
推理模型之后,蒸馏的对象也从「问题—回答」扩展成了 agent trajectory,即智能体完成一项任务的完整行动轨迹。以编程任务为例,环境可能包含代码库、编辑器、编译器、测试工具、任务描述和单元测试。教师模型在这套环境里从开始到结束完成任务,学生模型再学习它如何观察、调用工具、修改代码和验证结果。这里的训练原料已经不只是一段文字,而是「在什么环境里、按什么顺序、用什么动作把事情做完」。1

字节为什么选择不蒸馏:它押的是更远的能力

节目讨论了《晚点》此前关于字节 Seed 的报道。高洪浩转述,张一鸣在一次内部会议上表达过不允许字节做蒸馏;程曼祺则提醒,公开点名某些公司的材料并没有展示完整证据,因此不能把「有人被怀疑蒸馏」直接推成行业事实。下面的判断应当理解为节目对字节选择的解释,而不是对各家公司的技术行为作事实认定。1
节目给出三层可能的解释。
  1. 蒸馏有助于逼近,但未必带来真正超越。 如果学生模型一直围绕教师模型的输出优化,它能用更低成本缩小差距,却可能把研究目标锁在教师已经走过的路径上。对追求世界第一的团队来说,「快速接近」和「创造下一步」是两件不同的事。
  2. 它可能不是长期壁垒。 真正的壁垒可能来自独立的数据、训练方法、算法架构、研究组织和持续提出新问题的能力。蒸馏能够带来相对确定的短期收益,却未必能替代这些更难、也更不确定的投入。1
  3. 这是一种合规与长期声誉的选择。 字节在全球有业务,是否使用竞争对手的输出训练自己的模型,可能同时牵涉服务条款、监管关系和商业合作。即使拒绝蒸馏会让模型在一段时间内落后,团队仍可能把这种限制当作长期策略的一部分。
但节目没有把「不蒸馏」说成模型表现落后的唯一原因。它还提到,Seed 内部曾出现过关于这条路线的激烈讨论,团队如何分配算力、数据、研究人员和评测资源,同样会影响最终结果。一个更实际的推论是:如果不依赖外部前沿模型的输出,团队就必须把更多能力放到自有数据和数据工程上。节目提到字节在 2026 年重组数据团队、设立与 Seed 和 Flow 平行的数据与安全部门,但这部分是节目对公开报道的转述,读者不应把它当成对组织内部全貌的独立核验。1

蒸馏真正难在哪:账号只是入口,数据管线才是能力

如果把蒸馏想成「拿到几百万条回答就结束」,会低估它的门槛。节目提到的难点至少有四层:持续获得稳定的模型访问、获得真实而高质量的问题、搭建筛选与扩增流程,以及把这些数据以合适的比例送入训练。
真实用户的问题很重要,因为它比凭空编出来的题目更接近真实工作。一个真实问题可以作为种子,再让模型扩写、改写,生成更多变体;但团队还要处理去重、过滤、纠错、难度分层和数据配比。最后形成的不是一堆回答,而是一套数据管线:哪些问题留下、哪些回答可信、哪些轨迹值得学习、哪些样本会把错误一起放大,都需要经验和持续调试。1
这解释了节目为什么说,大规模蒸馏更像复杂的系统工程,而不是字面意义上的「抄作业」。访问来源的稳定性、用户运营、环境构造、任务生成、轨迹采集、质量控制和训练反馈彼此相连。某一环节成本太高、质量不稳,最后都会反映在学生模型的效果上。

能不能把蒸馏藏起来:结果可能难判,过程会留下信号

节目把「模型偶尔自称 GPT」之类的现象排除在可靠证据之外。模型出现身份混淆,不能单独证明它使用了某个模型的训练数据,更不能直接证明发生了蒸馏。更有意义的判断,需要长期、大量地比较输出行为,例如回答风格、格式、拒答方式和代码习惯;即便如此,也需要足够大的样本和更严格的方法,不能问一两次就下结论。1
从服务商一侧看,检测未必依赖最终模型的输出。节目讨论的重点是访问过程:某个账号是否高频、异常地调用服务,账号身份和用途是否可信,调用模式是否与普通用户不同。即使团队同时使用多个模型来分散来源,也不代表调用轨迹消失。反过来,如果团队把一个很大的开放权重模型部署在自己的机房里,再长期生成数据,推理成本、算力占用和电费也会变成可观察的约束。这里的结论不是「一定能抓到」,而是蒸馏很难无限、低成本、无痕地扩大。1

学生模型能超过教师模型吗

节目给出的答案分成「技术上」和「组织上」两层。
技术上,学生模型并非绝对不能超过教师模型。多教师蒸馏可能把不同模型在不同任务上的长处合并起来;在一个边界清晰的专项任务上,学生也可能通过更针对性的训练超过教师。但这不等于学生在通用能力、泛化性和所有任务上都更强。节目把它保留为一个开放的研究问题,而不是已经被证明的结论。1
组织上,蒸馏的危险在于它太便宜、太确定。团队如果把大量资源放到这条路上,容易减少对长期研究、底层算法和新问题的投入;研究人员也可能因为短期收益更容易被看见,而不愿意做回报不确定的探索。除此之外,学生还可能一起学到教师的错误、偏差和不理想的行为。于是,「能不能超过」不只是模型结构的问题,也是资源分配、研究激励和组织耐心的问题。1
节目用了一个有争议但好理解的比喻:运动员可以一边使用兴奋剂,一边继续训练;关键在于,短期助力会不会让组织产生侥幸和惰性。蒸馏也可以和预训练数据建设、强化学习、算法和架构优化同时进行,但「可以同时做」不代表组织一定能保持足够的长期投入。

合规、法律与「双标」:三件事要分开

节目把这场争论拆成三个层次。
第一是服务条款。Anthropic、OpenAI 和 Google DeepMind 等公司通常会限制用户利用服务去提升与其竞争的模型。节目认为,这类条款的表述可能很宽泛,因此某种行为是否违反条款,需要结合具体服务和使用方式判断。1
第二是法律责任。违反用户协议不自动等于构成侵权;是否违法、是否侵权,还要看数据取得方式、合同关系、司法辖区和具体行为。节目谈到美国公司训练数据时,也把「未经许可获取盗版书」与「购买后用于训练」区分开来,并明确表示后者的法律判断仍然复杂。这里不能把嘉宾的讨论当成法律意见。1
第三是行业叙事中的双标。当美国公司指责中国公司蒸馏时,中国公司可能反问对方是否也使用了未经授权的训练材料。这个反问可以指出标准不一致,但它不能自动抹掉两种行为在数据取得方式、合同关系和法律后果上的差异。节目最后把红线放在更明确的位置:通过黑客攻击侵入系统,或以攻击方式破解并提取隐藏的思维链,显然不是可以轻描淡写带过的「训练技巧」。

更便宜的智能,会怎样改写前沿模型的生意

蒸馏让后发团队更快接近领先者,领先者的下一步却可能由更强的模型和自动化研究推动。节目因此没有把「差距缩小」直接等同于「领先者失去价值」。如果最强模型能够用 AI 加速改进自己,领先者可能在某个阶段突然拉开更大的差距;如果领先者长期只领先几周或几个月,后发团队又可能持续追近。这取决于递归自我改进能否真正提高领先者的迭代速度,目前仍是判断而不是定论。1
更确定的变化在价格和需求端。节目提到,当前一些模型已经足够便宜、足够快,能够覆盖生产力应用里相当多的日常任务。如果用户的大部分任务用低价模型就能完成,前沿模型公司就会面对两种压力:既要继续花巨资追求最强能力,又要解释这些能力为何值得更高价格。模型之间的竞争因此不再只看排行榜,也要看每单位智能的价格、延迟、可靠性和能覆盖多少真实工作。1
这也是节目谈「斩杀线」时真正关心的东西:一个更便宜、速度更快、能力已经够用的模型,可能先挤压那些更贵但没有明显体验差异的产品。它未必马上摧毁训练前沿模型的商业模式,却会改变定价、产品分层和客户购买理由。对模型公司来说,问题从「能不能做到最强」变成「最强能力能否持续领先,以及用户是否愿意为这段领先付费」。

给读者的判断框架:先问它靠什么变强

如果你是普通用户,模型是否发生过蒸馏通常不会改变你今天能不能使用它。输出里偶尔出现别的模型名称,也不是可靠证据。更实际的做法是看它在你的任务上是否稳定、是否便宜、是否足够快,并把合规风险留给模型提供方和使用方处理。
如果你是投资人、求职者或模型公司的合作方,节目提供了几组值得追问的问题:
  • 模型的提升主要来自外部教师输出,还是来自自有数据、算法和评测能力?
  • 团队有没有足够真实的问题、可复现的环境和独立的质量评估,而不只是大量生成数据?
  • 蒸馏带来的短期分数提升,是否挤压了长期研究和底层能力建设?
  • 学生模型学到的是教师的可迁移能力,还是教师的错误、偏差和过时策略?
  • 产品的优势究竟是排行榜上的最高分,还是更低价格、更快速度和更稳定的真实交付?
  • 团队是否能解释数据来源、账号使用、合同条款和监管边界?
这些问题比「它到底有没有蒸馏」更难回答,却也更有决策价值。因为蒸馏既可能是合理的模型压缩技术,也可能成为短期追赶的捷径;它的长期价值取决于团队是否把它放在更大的数据、研究和组织系统里,而不是把它当成唯一的能力来源。

这期节目真正留下的悬念

《晚点聊》179 没有给蒸馏下一个非黑即白的结论。它更像是在一个灰色地带画出几条边界:技术上,蒸馏是让学生模型逼近教师行为的训练方法;工程上,大规模蒸馏依赖真实问题、环境、数据管线和算力;组织上,它可能带来确定的短期收益,也可能挤压长期创新;规则上,服务条款、法律侵权和行业双标不能混为一谈;商业上,更便宜的智能已经在迫使前沿模型重新解释自己的价值。
节目最后把判断留给听众:如果一个团队可以用更强模型的输出更快变强,它应该把这当成一条公开承认的工程路径,还是把最宝贵的时间留给没有教师答案可抄的研究?这个问题的答案,可能决定下一轮模型竞争究竟是「谁更会学习」,还是「谁能提出别人还没有答案的问题」。

完整音频转录稿

以下是对本期完整音频完成的 ASR 转录。转录保留识别原文、重复、误识别和夹杂的片段,不对句子做内容性改写或删减;仅按两个说话人连续发言分段,并在约每 10 分钟处设置时间轴。音频中的说话人已依据开场自我介绍对应为高洪浩(主播)与程曼祺(嘉宾);个别重叠、广告或环境声造成的识别片段仍按原始识别结果保留。1

时间轴|约 00:00

高洪浩(主播)
我可以理解为它就是一个抄答案的过程。
程曼祺(嘉宾)
它肯定不是我们原初意理解的那种抄答案,就是你能直接有个答案就抄过来。 因为它还是一个训练的过程。 包括这个过程中间你也要防止自己被坑吗?
高洪浩(主播)
对,我知道有某一家模型就是用中软站,结果发现它其实蒸出来的是自己的,就自己在蒸自己。
程曼祺(嘉宾)
所以综合来说就把技术和组织都考虑进来的话,那张一鸣说有可能很难超越,也许是一个真实的情况。张一鸣可能不是最懂技术的,但他大概率是最懂人性的。
高洪浩(主播)
大家好,欢迎收听《晚点聊》,我是洪浩。 那今天又是我们《晚点》编辑部自己录的一期节目,没有嘉宾,而我是今天的代班主持。 那我们的嘉宾呢,其实是大家每一期都能听到的曼祺。
程曼祺(嘉宾)
对,今天是我和洪浩一起来聊我们最近做的一个报道,是关于蒸馏这个话题的。 然后开头我先叠个假,就是正常来说这个话题最合适的方式可能是你找到一个一线从业者,他做过这件事情,然后请他来把他聊得比较透。 但也就像我们那篇文章开头写的,所有人都会去关注这件事,但大家不会公开去谈论,所以其实他不太好找到嘉宾来在节目里去讲这个事情。 那我们最后就是我们自己来聊,这个信息可能就是来自于我们最近这一段时间和很多不同公司的
高洪浩(主播)
主播是《晚点 LatePost》主席。
程曼祺(嘉宾)
我对技术也没那么精通,我就尽量用我觉得我理解的方式来解释。 典型的为了变强的蒸馏,其实大家主要讨论的是这个嘛。 我理解它的这个过程简化来描述就是你先有一堆问题, 然后你去问一个很强的模型,比如说你去问 Fable, 你就得到了很多回答对吧,然后这个提问和回答就会构成一堆这种数据队, 然后你再用这些数据去训练你想去提升的技术, 那个学生模型就是你自己的模型,然后你让学生模型的输出行为去接近你想学的教师模型的输出行为,你让两者的差异越来越小,这是比较典型的蒸馏。 当然我刚才那个是一个简化的描述,比如说你中间从那个教师模型那通过提问得到的东西,它其实是含义可能是在变化的。 比如说有了推理模型,就是 OpenAI O1 系列这种模型,DeepSeek R1 这种模型之后,它不是简单的题目和回答,然后它中间还会有推理过程,然后包括后面 agent 也越来越发达了嘛,所以这个还可以扩展到一个完整的 agent 完成一个任务的过程。
高洪浩(主播)
我可以理解为它就是一个超答案的过程。 比如说我问我这个模型一个问题, 然后它可能现在它没有蒸馏之前, 它的回答是非常的差的, 或者是它可能都不知道怎么回答这个问题。 然后我去问 Fable 一个问题, Fable 它能给我一个非常精妙的一个推理过程, 以及一个最后的结果。 然后我就直接把这个答案告诉我的模型说。 以后你遇到这个问题,你就按照 Fable 这样的方式去回答。 然后这样的一个问题多了,答案多了,最后我的模型也懂去回答,包括去泛化,它可能类似学习 Fable 的这种推理思考方式,变成了一个很智能的模型。
程曼祺(嘉宾)
就是我觉得它肯定不是我们原初意理解的那种超答案,就是你能直接有个答案就超过来,因为它还是一个训练的过程。 就现在这种蒸馏主要是用在后训练和中训练的,你要用算力,然后你是要有数据要去放到模型里去训练,就是一个比较高难度的去获得答案的过程。 这个里面不是说像操作业那样人家写 A 你就 A 的。 你这个是要有一些方法和技巧和你的智慧和你的劳动在里面的。 所以它不是简单的操作业,结论就是这样。
高洪浩(主播)
它虽然也是操作业,但是它是有门槛的操作业。
程曼祺(嘉宾)
其实可以不用这个类比吧,因为类比肯定是会丧失一些精度了吧。 但是我没有想到一个特别好的类别,就是比如它特别像日常生活中的什么行为啊。 大家描述的过程是我刚才说的那样。 就接着刚才那个说法,就说像 Agent 更发展之后, 就其实你从教师模型里获得的整个的轨迹数据, 它的含义是在变得更复杂了。 这个正好是文章里面又特别展开的,我播客里也可以补充一下。 就是智能体的轨迹蒸馏,如果就对比到我刚才说那个经典的过程的话﹐ 他现在要获得的东西就是他要从教师模型上榨取的那个数据, 它就不再是静态的题目推理过程和答案, 它是扩展成了就是一个智能体, 你在一个环境里面你去完整的做完一个任务的整个过程。
高洪浩(主播)
我觉得要先跟大家解释一下环境这个概念。
程曼祺(嘉宾)
环境就是让 agent 真正把任务跑起来的一整套条件和系统, 就比如说你要让他做一个编程任务, 你要给他一个代码库, 中端还有必要的工具,比如代码编辑器、编译器,还有测试工具,然后再设置任务和单元测试,就是看这个程序跑对了没。 然后具体来说,这个更强的教师模型,比如说你用 Fable 可以干什么,你可以让它来造一些题目,但是一般大家是会先有一些真实的题目,然后再去改写和扩增这些真实的题目,然后你也可以让它来造环境,因为其实很常模型都有 coding 的能力嘛,它本身就是可以去构造这种环境系统。 然后你也可以用它来造轨迹,这个是比较接近典型的蒸馏的,相当于就是你让这个 Cloud 自己在它造的这个环境里面,它去把这个任务做一遍,你会获得它一个完整的做这个任务的过程,其实它也是一堆数据嘛,然后你再让你的这个学生模型,你自己要训的这个模型去行为上接近它做这整个任务的这个过程。 但实际上你也可以不做这一步。 就如果不做这一步的话, 我就是用这个更强的模型来去评估我自己的模型在这个环境里做任务做的怎么样。 那如果是这个的话, 它可能就不是蒸馏了。 我觉得它能描述成说你用了一些最强的模型的数据和输出来帮助你做一个智能体的强化学习。 对,那如果总结一下的话,我觉得典型的蒸馏就是,你是在让这个学生模型去学这个教师模型的输出,然后让这两个行为越来越接近。 就是你用到了对方要么是他推理的轨迹,要么是他完成一个比如智能体任务的这种完整的轨迹。 所以有一个误区可以讲一下,就并不是说在训练一个模型的过程中,只要你用到了另一个更强的模型的数据和输出,它就是一个典型的蒸馏。 但是,你确实是使用了更强的币源模型的输出,在提升和优化你自己的模型。 然后,说到这个,就正好想到一个问题,即使是这种情况,对 Anthropic、OpenAI 和 Google DeepMind 这些公司来说,也是违反了他们的用户协议的。
高洪浩(主播)
就是他们原本的模型的用户协议里面已经说明了,就是我的模型吐出来的这些内容也好,答案也好,是不能被拿来去做训练的。
程曼祺(嘉宾)
要更宽泛,是说你不能利用我的服务去提升和优化你自己和我竞争的模型。 其实这个是很宽泛的。 所以哪怕有些行为它不是蒸馏,在领先的避援方看来你也是违反用户协议的。
高洪浩(主播)
用户协议有法律效应吗?
程曼祺(嘉宾)
这个我觉得可能得咨询特别专业的律师。 我觉得从朴素的这种想法上来说,目前是个灰色地带吧。 因为它这个范围其实很宽泛嘛。
高洪浩(主播)
因为其实整体整个蒸馏的历史也没有那么长,对吧? 就是我们现在,我不说原理哈, 就是现在大家真正开始做蒸馏这件事情或者大规模做这件事情, 从什么时候开始的?你觉得大概是。
程曼祺(嘉宾)
我觉得他表现,其实你从就 Anthropic 这些公司的声明里也能看到嘛,比如说 Google 今年二月的时候,他发了一个文章,然后那个文章里的原话是说我们观测到去年开始蒸馏等一些其他的这种他们称之为偷取 IP 的行为变得越来越多。 我获得的信息就从二五年到现在是规模变大了很多。
高洪浩(主播)
二五年什么时候?
程曼祺(嘉宾)
25 年年初啊。DeepSeek 出来的。DeepSeek RE 发布之后。但我觉得这个关键的时间点还不在 RE 啊。它中间有两个比较重要的节点。一个是在 24 年 9 月的时候 OpenAI 发布了 OE 这个模型。因为 OE 是第一个算是开启了推理模型这种范式的一个模型。然后 OE 是带来了两个比较大的技术上的变化。 这个在我们自己写蒸馏的那篇文章里也提到了。 一个就是 OE 它揭示了你在后训练中做大规模的强化学习是可以让模型学到推理策略的。 这个推理是 reasoning。 然后蒸馏本来也主要是用在后训练的。 所以在这个阶段你更多的去做蒸馏,你的投入回报是上升了。 然后 OE 还有一个发现,或者说它开启了一种新的方法,就是你在测试时时间,就是在模型的推理阶段,这个推理是 Inference,就是模型使用的阶段。 你去给它更多的算力,然后让它去围绕一个问题,一步一步的想生成更长的思维链,也能持续提升这个模型的性能。 然后有了这个思维链和更多的推理过程之后,就这一部分它也是模型使用阶段的产出。 就相当于作为用户理论上你是可以看见的,但是它可以隐藏,但你能通过一些手段去还原,然后这部分东西就变成了更好的来蒸馏的数据的原料。
高洪浩(主播)
相当于 Visiting Model 出来以后,大家发现有漏洞可以钻。
程曼祺(嘉宾)
这不是漏洞。
高洪浩(主播)
对,不是漏洞。 或者说有方法可以蒸馏了。
程曼祺(嘉宾)
也不是有方法,蒸馏这个方法之前就有啊。 只是说你能蒸的那个原料变得更丰富了呀。 就你还有了推理过程这部分嘛。

时间轴|约 00:10

程曼祺(嘉宾)
所以就是第一个变化我觉得它提升了蒸馏这个方法的投入回报比。 然后 OE 带来的第二个变化是说有了更多高级的模型可以生成的、可以用于蒸馏的数据。 嗯。 然后蒸馏变得更多的第二个比较重要的时间点,我觉得确实是跟 DeepSeek R1 当时发布有关。 据来说就是 R1 的技术报告那会发的时候,就 1 月份嘛,25 年 1 月份,它还发了 6 个小的蒸馏模型,然后这 6 个模型 4 个是昆 2.5 的底座,然后还有 2 个是 MetaLama3 的底座。 6 个模型都是把 R1 当作教师来选,然后他大概就是在试这种方式能不能让小模型的能力提升。 其实这个才是蒸馏最开始的一种比较主流的目的,就是为了压缩的,就把一个大的模型的能力压到一个尺寸更小的模型里面。 然后它的好处就是说,大的模型一般来说就比较贵和慢嘛。 一个它是可以降低成本,可以提高速度。另外就是有一些场景,比如说在手机上,在汽车上,这些端测算力更小的地方,包括未来的机器人上,其实需要相对小的模型,因为它对延时,对算力的要求都更多。 就比如说我现在都能记起来,我第一次在线下采访中间跟人比较长时间讨论蒸馏是个什么情境,是当时去采访豪默的 CEO。 主播是《晚点 LatePost》主席。 请不吝点赞 订阅 转发 打赏支持明镜与点点栏目
高洪浩(主播)
其实像比如说 DeepSeek、千问也会做这种,对吧?
程曼祺(嘉宾)
对,千问是做了很多的嘛,因为千问每次一发其实它的开源的尺寸是非常多的,然后后来就是到我们现在看到的蒸馏嘛,我们现在看到的蒸馏其实就是为了变强的蒸馏。
高洪浩(主播)
所以这个风,为了变强这个风气是谁带起来的?
程曼祺(嘉宾)
我觉得这个可能你很难追溯到是谁带起来的,我觉得就你。 其实压缩和变强是一体两面。 就我把一个大的模型的能力压到一个小的模型的能力里面,我其实也是让这个小的模型的能力在变强。 它一开始就有这个潜力,它就有这个空间。
高洪浩(主播)
今年以来大家对于蒸馏的这个讨论是格外的热烈,比去年热烈更多。
程曼祺(嘉宾)
对啊,那就是从 25 年之后大家蒸馏多了呀。 包括那个 Anthropic、OpenAI、Google、DeepMind 什么的,他们都在 26 年年初开始了。 他们其实也有更多的公开的一些文章,包括他们给美国政府的一些公开信里面,他有更多的去提到就是说中国公司在蒸馏他们。 我觉得这是一个比较明显的导火索吧,就让大家更多的来讨论蒸馏。 还有一个更重要的大的背景,就是最近这段时间,中国的开源模型的表现是明显逼近避源模型的。 比如说 K3 就是一个里程碑,其实 K3 在美国是引起了很多讨论和争议的。 这个我们在上两期节目,就 177 期专门聊 K3 的时候,开头也是聊了这个事情。 所以各种原因累积吧,一个是它规模应该确实变大了,然后另外就是有了更强的开源模型逼近美国的避免模型之后,本身中美对这个话题都更关注,所以蒸馏被推到了风口浪尖。
高洪浩(主播)
但其实也有一些公司不蒸馏对吧,就我们前阵子也报道了。
程曼祺(嘉宾)
那不是你写的吗?你编辑的。
高洪浩(主播)
对,这个字节,就是张一鸣非常罕见的一个露出,我们已经很多年没有写过这三个字了,对,然后…… 我们在报道里面其实也有写到嘛,就张一鸣在 SEED 的一场内部会议上面提到说,他不允许字节去做这个蒸馏,然后包括我们之前其实也了解到字节很长一段时间都没有去做蒸馏这种行为。
程曼祺(嘉宾)
严谨的来说,罕见的有人不蒸馏,并不代表其他人都蒸馏。 Anthropic、OpenAI 和 Google DeepMind 说谁谁谁蒸馏了,它也并没有展示完整的证据。 然后说回你说这个话题,其实我有关于这个报道本身,我其实有一些想问你的地方。 因为就当时我看这个报道的原文,它只是说张一鸣说他反对蒸馏。 其实他好像是没有特别多上下文的语境或者说他反对哪一种蒸馏。
高洪浩(主播)
请不吝点赞 订阅 转发 打赏支持明镜与点点栏目
程曼祺(嘉宾)
你刚才的问题是说怎么看它明确表态不蒸馏这个事儿?
高洪浩(主播)
因为字节它其实是一个算力非常多的公司,然后现在整个大模型的竞争又极其激烈。 再加上可能我们一直觉得 C 的表现吧,并没有预期中的好像说字节一定会 SOTA,或者甚至它在很多领域离 SOTA 还很远。 比如说 Coding,比如说 Giantic,就是智能体的这个领域其实离真正的一线还是挺远的。 对,那他居然主动拒绝使用蒸馏这种方式,为什么,你觉得?
程曼祺(嘉宾)
这个问题我们可以讨论,因为你对字节比较了解。 首先你那个报道里面不是已经写了几个原因吗? 我觉得也都挺有道理的。 一个就是张玉明他认为说,他觉得蒸馏是短期内可以改善模型表现,但本质上是在复制 Cloud 的 EO 的能力。 所以你这么继续干下去的话,你最多只能逼近对方,你是不能实现超越的。 那潜台词就是,SEED 追求的肯定是做到世界第一吧,我理解啊,就最强的模型。 这是他们的抱负和追求。 然后第二个原因就是那篇文章里也写到, 就是他希望自己可以从更底层的维度去构建自己在 AGI 上的壁垒。 就有可能他认为蒸馏不是一个长期壁垒。 当然其实大部分从业者也都是这么认为的。 然后最后一点,最后一点不是个原因的解释, 我觉得是一个比较强的表态, 就是说即使不蒸馏意味着字节会在技术上短暂落后国内的一些竞争对手, 但他们也不采用这个捷径来推进自己的模型能力。 我觉得他自己说的是比较清楚。 然后有一些我觉得可能我不确定他这个权威想讲什么呀。 我觉得他作为一个这么大的公司, 而他在全球都有业务嘛。 他对合规对其他国外的公司怎么来看他, 我觉得他会有更多的考虑吧。
高洪浩(主播)
你觉得 Seed 今天没有办法 Sota 的核心原因有没有可能是因为就是他没有蒸馏。 这个所谓的 Sota 是说国内 Sota 吧。
程曼祺(嘉宾)
你觉得吗?
高洪浩(主播)
我觉得有一定的原因吧。
程曼祺(嘉宾)
因为你接触些他们自己的人吗?
高洪浩(主播)
是。
程曼祺(嘉宾)
他们自己怎么觉得?
高洪浩(主播)
我觉得不蒸馏是一个挺重要的原因之一吧。 但你也不能完全归咎到这件事情上面。
程曼祺(嘉宾)
虽然这是个万金油的回答,但是我觉得它是挺接近事实的。 其实据我了解,比如说 Seed 2.1 应该是用了一些蒸馏的手段,然后那个是 6 月份发的。 我觉得他在这之后应该是经过一段时间的思考,他是做了一个比较明确的选择。
高洪浩(主播)
对,他们内部应该是有比较激烈的讨论,最后还是决定不要蒸馏。
程曼祺(嘉宾)
而且其实你看它这个时间很短,因为 2.0 到 2.1 的话,你算它这个开发的时间我觉得也就是今年吧。 然后在那之前有比较长的时间,两年多,两三年的时间,字节应该是确实不怎么蒸馏的。
高洪浩(主播)
你觉得张一鸣自己说的不蒸馏的核心理由就是蒸馏只能逼近,不能超越,这成立吗?
程曼祺(嘉宾)
我觉得是这样的,就是首先是张一鸣自己提到的,如果研究蒸馏这条路,最多只能不断逼近对方,很难实现真正超越,这个是有可能的。 我之前也问了很多从业者,大部分人认为这件事在技术上是否绝无可能,我是指就是说蒸馏是否学生模型就不能超过教师模型,它可能不是绝无可能的。 是有可能的,这我觉得是一个研究课题吧,其实蒸馏有很多方法也可以优化,对吧,比如说我是不是可以不仅学某一个模型,我学更多的教师模型,我博彩中长,当然有可能你训不好,就是你博彩中短都有可能,就安利贵他是有很多可以去探索的空间的。 大部分人认为蒸馏会有隐患或代价,就是组织和人的激励。 如果说一段时间里面,你把很多精力和重心放在蒸馏上,因为蒸馏确实是一个相对来说它比较经济成本比较低,而且它比较有确定性,这个是更关键的,比较有确定性的去提升你的能力的方式。 如果你把重心放在蒸馏上, 这个相对有确定性的方式上,那组织里一些去做更长期的探索,去走一些更不确定性的路的项目或者说人,他们可能就得不到足够的资源和认可。 我觉得认可也很重要,其实这种顶尖研究员他还是很需要一个就是这种 主播是《晚点 LatePost》主席。 之前就在想那个问题,就是学生模型是否一定不能超越教师模型。 然后我也分享了一些我当时就获得的这个行业里的一些从业者的反馈。 然后有一个人在极客上的留言,我觉得就挺有意思。 他就是说张一鸣可能不是最懂技术的,但他大概率是最懂人性的。 就可能会有这种组织上的代价吧。
高洪浩(主播)
这个说的蛮好的。
程曼祺(嘉宾)
另外蒸馏还有一些内在的技术上的一些问题,比如说你有可能会学到教师模型的一些错误和它的一些什么巨大表现,总之你的行为会比较接近它,就你也可能会学到一些不好的东西,所以它也有一些技术上的问题。

时间轴|约 00:20

高洪浩(主播)
那其他公司的人难道就不会意识到这个问题吗? 因为我们知道可能国内可能也有几家公司表现出来它对 AGI 是有信仰的,对吧? 我觉得他们应该也能看到蒸馏的一些代价也好,一些负面的影响。
程曼祺(嘉宾)
我觉得取决于你认为这个代价是否是可控或者可接受的吧。 这文章里也有一个比喻嘛。 一个运动员理论上是可以即刻兴奋剂又勤加训练的。 也许真的就有人是这么干了对吧。 只是说一般而言,你如果刻了兴奋剂之后你肯定是会有一些侥幸和惰性的。 Maybe 其他人想的是我可以克制这方面的,我可以减少这方面的问题了,或者我不一样了。 这个我不知道,这个你可能得去问每个公司的这些决策者他们是怎么想的。 还有一种可能,就因为蒸馏只是优化模型的方法之一,对吧? 有可能对一些公司来说,它什么阶段什么方法有用,它就会在这个上面贵做投入。 过了一段时间,也许你会发现更有用的方法,其实你就可以去用那些更有用的方法。而且确实在实践中,一个公司他做蒸馏,首先这肯定不代表他后训练的数据全部都是来自于蒸馏的,他肯定也会有别的数据,另外也不代表他不干别的事儿。 他肯定也得做 InfoR 的优化,然后他可能会去有一些算法和架构上的优化等等,他也会去更好的去构造他自己的预训练的数据集,他还有很多别的受到感恩。 其实上次选题会的时候也说到,自从张一鸣有这个明确的表态之后,有一些人想从 SEED 离开吗?
高洪浩(主播)
是是是是是。
程曼祺(嘉宾)
确实是这样的。
高洪浩(主播)
但这个其实也很个体,你说有两三个三四个人离开好像也不稀奇。
程曼祺(嘉宾)
然后他们个体的原因就是认为他们觉得不应该放弃这种方式是吗?
高洪浩(主播)
因为你的职业生涯是有限的,就是你每一个人的从个体的角度来讲的话,那我当然是希望比如说我在 Seed 的这几年时间里面做出自己的代表作。
程曼祺(嘉宾)
明白,就是希望我的职业履历里面我所在的团队是做过最强的模型的,就比如说至少中国最强的模型。
高洪浩(主播)
对啊,我最宝贵的人生阶段或者说我的职业阶段可能就是这几年,然后一直在里面陪着你好,当然这个是非常个人化的一种想法,我觉得也合理吧。
程曼祺(嘉宾)
而且其实你去推测的话,有人会这么想,也可能会有人被张明的这种表态干招。 对对对。
高洪浩(主播)
那如果他不蒸馏的话,从你的角度来看的话,他现在更应该做什么,或者是说他的重心应该是什么呢?
程曼祺(嘉宾)
字节怎么去构造这样的数据吗? 而且你已经看到他有动作了,也是本周,就智能涌现有一个报道,是说字节从 6 月开始重组数据团队, 然后现在是要成立一个新的和 SEED 和 FLOW 平行的一级的 AI 部门,是叫 AI 数据和安全。 就相当于他把数据应该是作为一个很壮的能力给他抽出来,然后成立了一个级别还挺高的一个大的团队吧。 所以我觉得他得自己去获得某种你不依赖于外部的。 领先的避免模型不依赖于 OpenAI、Anthropic 这些公司的数据的能力。 我又有想问你呢,就他们新成立的这个 AI 数据安全部门的这个负责人叫王英磊,Adam Wang,这个人你之前接触过吗?
高洪浩(主播)
他是原来在 TikTok 负责直播的,他跟文嘉和 Alex 都回报过。
程曼祺(嘉宾)
OK,所以相当于跟他们之前都共事合作过。
高洪浩(主播)
对。
程曼祺(嘉宾)
因为我看公开信息就是说他之前在 TikTok,然后现在来负责数据,因为我不太确定这两个事之间的相关性。 就说到数据这个事,其实现在有很多第三方的数据公司也做了表达。
高洪浩(主播)
对,所以这个我也很好奇,就是如果我用我第三方的数据公司去做蒸馏,然后我去买他们的数据,那这个算什么呢? 因为我也听说一些公司他可能说自己不蒸馏,可能在题外去做一些操作来实现蒸馏的这个目的。 那比如说我买第三方数据,这个算蒸馏还是不算蒸馏?
程曼祺(嘉宾)
我觉得这有很多操作空间吧,分两个层面来说。 就是它在技术上我觉得如果你是让你自己要训练那个模型, 然后你去逼近你获得的一堆更强的模型的这个输出和行为, 我觉得技术上它是正流。 至于法律上或者说你是否违反对方用户协议上, 这个问题是否能绕开有很多操作空间,包括如果之后美国有更严厉的限制的话,可能也有对方政府的一些限制,这就不单纯是技术问题了,这应该就会涉及到很多不同层次的问题了。
高洪浩(主播)
我们接下来可以讨论一下更多公司或者说整个行业的情况,比如说 DeepSeek、Kimi、智普、千问这四个模型里面,从你的角度来看你认为谁最可疑?
程曼祺(嘉宾)
首先我就想访问你,为什么是这四个公司?
高洪浩(主播)
因为这个不就是大家传的比较多的就这四家?
程曼祺(嘉宾)
首先这个肯定没法评论,就到底谁在蒸馏谁不在蒸馏。 其实我们可以看就美国这些公司他们是在点名谁吗? Anthropic 2 月的时候它是点名了三个公司,是 DeepSeek、Kimi 和 MiniMax。 6 月,他又点名了一家公司是阿里的针对。 其实反而智普是没有谁说的。 没有人公开来说的。 没有美国公司说智普在蒸馏或疑似蒸馏。 OpenAI 是说 DeepSeek 有这种疑似蒸馏的行为。 所以这只是公开信息分享一下。
高洪浩(主播)
那你怎么看,比如针对前一段时间阿里被 Anthropic 点名以后,整个集团都开始禁用 Clock Code。
程曼祺(嘉宾)
因为 6 月的时候,Anthropic 他应该是给美国的国会有一个信里面就提到了, 前问一次吧,跟他进行了很多交互,是有 2880 万次。 而且当时 Anthropic 说的这是有史以来发现的规模最大的蒸馏攻击。 我觉得这两个事可能没有直接的必然的联系。 首先他可能是一个合规的表态吧, 因为本来中国的用户理论上就不能用 Cloud 的模型。 然后另外我觉得他也会要考虑自己的数据安全,
主播是《晚点 LatePost》主席。 对 AI 的使用就是通过这个模型,对吧?他可能想让他们用自己的模型。这我觉得他确实不一定和蒸馏有关,但是他也是在中美模型竞争的这个大语境里啊。 如果中国所有头部模型都不允许蒸馏了,你觉得现在格局会发生什么样的变化? 你如果让所有人都不蒸馏,那所有人其实就在这一点上都是一样的。 对。 那就还是看你别的能力吧。 不好判断,我感觉可能没有什么变化吧。 不会有变化。 因为你还是得看你别的能力。
高洪浩(主播)
那你的意思就是说,Kimi 还是搜他,智普还是能领先,Sid 还是落后。
程曼祺(嘉宾)
你看你这个又预设了其他人都在蒸馏而字节没有蒸馏,对吧? 然后如果所有人都不蒸馏,字节是不是看起来就跟大家差不多了? 是。 这我真的没法判断,而且这个假设肯定也很难实现了。
高洪浩(主播)
对,那我们其实有什么迹象可以看出一个模型是不是蒸馏的吗? 比如说模型有的时候经常会说,比如说一个非 GPT 的模型,它在回答的时候有的时候会说自己是 GPT, 或者是说我是 OpenAI 训练的,那有的人就会把它来当成蒸馏的证据,你觉得这个靠谱吗?
程曼祺(嘉宾)
这个肯定是不靠谱的呀。 就你直接问一个模型 A 你是谁,他说是 B 的话,这不能证明 A 蒸馏了 B。 其实 24 年 11 月的时候就有人做过这种研究,大概他们当时是测了 27 个模型,有中国的有国外的。 他设计了一个 77 个问题,这个研究就是在研究模型的身份混淆的问题。 就也会有出现比如说 GBT-4 会说自己是 GBT-3,然后 Gemlight Pro 会说自己是百度文性。 字节 Seed 会说自己是 GPT,对吧? 那这个论文的结论是说你仅凭他们身份混淆,其实很难判断谁使用了谁的训练数据,更不能说明蒸馏。 更合适的方式可能是你去看他们的输出分布是否接近,就还是看他整个行为是否接近。
高洪浩(主播)
你的意思比如说他说话的方式,他的输出的格式,拒绝回答的方式,或者是代码的风格。
程曼祺(嘉宾)
对,但我觉得这需要很大的料,对吧?你肯定不是你问他一两次,然后你觉得很像他,你就能证明什么的。 然后另一方面就是你说你要去判断一个模型是否蒸馏的原因是什么?
高洪浩(主播)
对,可能提这个问题可能先入为主有一个印象吧,可能会觉得说蒸馏是不是一件不好的事情吗?对吧?
程曼祺(嘉宾)
如果作为用户来说的话,这肯定不影响你使用。 但确实可能,假如说你是个投资人,或者说你是一个要买二级商股票的人,你是一个想找工作,我在这几个公司里选一个,那可能取决于你的技术判断吧。 就你认为蒸馏这个事长期来说对一个模型研发团队是不是一件好事。 然后你去看它蒸馏了没,这个我觉得就对你比较有价值了。
高洪浩(主播)
那我们说回蒸馏的方式吧,你觉得蒸馏真正困难的地方在哪里?比如说你是真正的拿到了这个几百万条的 Cloud 回答比较难,还是说我应该知道怎么去向 Cloud 提问比较难?如果我们所有公司都可以狠狠地蒸馏,那蒸馏的核心竞争力是什么?
程曼祺(嘉宾)
我觉得可能很难回答哪个部分更难,可能每个公司不一样,看你自己的博弈环节是什么。 就我可以讲一下我知道的,真的有比较有难度的一些环节,这个也是在文章里有展开的。 一个就是在最开始嘛,你怎么获得稳定高频的去访问这些模型的账号,然后包括你怎么去做用户运营。 就用户他可能是帮你提供一些真实的高质量的数据的。
高洪浩(主播)
用户提供数据?
程曼祺(嘉宾)
对,因为你有些真实数据是从用户数据到筛的。
高洪浩(主播)
你是说用户的提问吗?
程曼祺(嘉宾)
提问,对。真实的提问可能只是一个种子,然后你可以围绕它再去做扩增和改写。 有一种行业里会有从业者提及的做法吧,就是你建很多中转站,然后你再让一些人来通过这个中转站去用领先的 主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 Late

时间轴|约 00:30

程曼祺(嘉宾)
请不吝点赞 订阅 转发 打赏支持明镜与点点栏目 OK 好吧 对 第二个整体来说我觉得就是一套数据管线吧 包括你怎么去构造题目其实也是一个构造数据的过程 然后你如果说你有很多这种高质量的用户在真实的 任务真实的场景下有很多这种真实的提问,你从里面肯定是要筛选的,那你怎么筛选、过滤、去重这些真实的数据,然后你怎么进一步用模型去扩增和改写这些数据,中间还有涉及到纠错以及整个就是这个数据的形式和配比。 这套数据管线我觉得是会有一些难度,或者说至少它是有经验 knowhow 在里面。 以及你整个这个系统它是否比如说成本比较低了,然后比较稳定了,这个也会影响你的大规模这种操作的时候的效果和效率吗?
高洪浩(主播)
所以整体来说它是一个比较复杂的系统工程,这回到你前面说它是不是操作业吗?
程曼祺(嘉宾)
如果你非要说它是抄作业的话,那就是一个非常复杂的,就抄的那过程非常复杂,本质上就已经不是抄了,不是你一笔一画你对着人家写一遍就对了。
高洪浩(主播)
我理解了。
程曼祺(嘉宾)
大概就是这么实现的吧。
高洪浩(主播)
所以一家公司如果它真的想隐藏自己这种蒸馏的行为,你会觉得最常见的方法是什么? 他想上谁隐藏?他是想对就是… Anthropic 和 OpenAI
程曼祺(嘉宾)
OK 那我不知道
高洪浩(主播)
那如果他不用 API 而是直接下载一个 OpenWidth Frontier 的这个模型 然后在自己的机房生成几亿条数据 外部是不是几乎是没有办法去发现的?
程曼祺(嘉宾)
你就说他去蒸馏一个开源模型 就假如说一个开源模型变得很强了对吧 其实最近黄仁勋在有一个采访里面 就 7 月 20 几号的一个采访里 他也被问了这个问题。 现在的很强的开源模型是很大的。 比如说 K3 是接近 2.8,接近 3T 嘛。 然后像 V4 也是 1.6T。 首先就是你部署一个这种这么大的开源模型,它也需要挺多算力的。 然后你如果部署完之后你还持续地用它在跑各种数据,你的电费应该也挺高。 就总之就是它会比较容易被监测到。 如果说政府或者说其他人认为这是一种隐患的话,可能政府比较好监测到吧。 如果我一家公司同时向 Cloud、GPT、Gemini 甚至是 DeepSeek 签问,每一个模型我拿一点点数据来,然后再让自己的模型去筛选、去重写,那我是不是就很难看出我是某一个老师的痕迹? 有可能,但是这个并不能像币源的厂商隐藏你的蒸馏行为,对吧? 因为只要你有一次,就比如说大规模高频的去使用它的 API,就有类似,对对对,就你有类似这种异常行为,其实对方就有可能能看见嘛。 他其实不是从结果来发现的,而是从这个过程中发现的。 这次还讲了他们会加强对教育、研究还有创业公司的这些账号的身份认证。 这个我刚才说的,就是你运营的过程中间,比如说你找一些高校学生来用,其实它也是相互应能。 然后你比较关心这个问题,是因为你比较关心怎么藏这个事儿是吗?
高洪浩(主播)
是。 你觉得藏了之后,然后它的结果是什么了? 我觉得很直接的一个结果,比如说这样举例我不知道合不合适啊,比如说千文也好,Kimi 也好,他们现在是没有在美国的实际清单上面的。 那当然我首先我没有说他们蒸馏了哈,假如说我我是 Kimi 或者我是 CM,我想去做蒸馏这件事情,我又不想被上美国实际清单,我不想被 OpenAI 发现。
程曼祺(嘉宾)
那我觉得这可能也算是蒸馏的另一种代价吧。 就你确实会有一些合规的隐患。 而且这个叫什么? 要赏人不知除非己莫为。
高洪浩(主播)
你总是会有些痕迹的。 所以其实蒸馏本身是会受到一些约束的。 它也不可能无限的这么大规模的扩展。 包括大家也会考虑成本啊。 那我们说说这个蒸馏的好处吧。
程曼祺(嘉宾)
就是我们刚才也提到嘛,学生能不能超过老师。
高洪浩(主播)
你觉得呢? 其实我刚才说了呀,我觉得技术上是有可能的,或者至少说我接触的从业者认为技术上是有可能的。
程曼祺(嘉宾)
其实现在在后训练去合并不同方向的专家的能力的时候,就是会用到这种多教室的蒸馏。 多要师的蒸馏这个思路是否也可以用来让模型变强?我这纯粹就是一个拍脑袋的技术推想,但也许会有人去试这个方向。包括之前有一些研究,就这个文章里有写,其实你在一些比较特定的任务上,你是有可能让一个学生模型就在那个具体任务上去超过教师模型的。 当然这不一定代表这个学生模型整体上就比这个教师模型,比如它放化性、通用性,然后各方面的能力都更强。 所以我觉得它是一个开放式的可以去被研究的问题,就你说学生模型能否超越教师模型。 其他的好处比较明显,好处就是一个你可以相对低成本确定性高的去接近更强。 请不吝点赞 订阅 转发 打赏支持明镜与点点栏目 世界第一的标准,那就是按照现在的各种对智能的评测,它表现最好。 其实就是回到我刚才说的那个问题,那如果你已经学了最好的教师模型,你还超过了它,那你是有可能变成世界第一。 我觉得这是个技术上的开放的问题,但是你能不能持续是这个第一,那确实跟你的创新能力有关。 其实现在就是个领风骚几个月嘛,而且其实你可以观察到一个现象,就像 Anthropic 这个公司, 它至少今年上半年有几个月,它还是持续的领先了。 主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 LatePost》主播是《晚点 Late 会这种感觉更急迫吧,就是看起来开源已经非常接近避怨,但首先它现在还没有接近,其次其实在如果你拉到半年的维度,那中间我觉得有几个月的时间 Anthropic 还是领先的,Anthropic 和 OpenAI,所以可能现在这个阶段过了之后,也许对方又会,我就指最强的避怨模型的公司,他们可能又会跳一步,然后其他公司赶上,然后他们又会跳一步。
高洪浩(主播)
我们现在看到的实际情况可能是你通过蒸馏的方式,你暂时是没有办法超过老师的。 但换个角度来想吧,对于所有商业公司来说,可能现在有了蒸馏这样的方式,你的后发者反而其实是有优势的嘛。 你可以用更新的这种数据,更强的模型来蒸馏,获得更好的数据。 然后你对于领先者的这个差距其实是逐渐缩小的,可能也就短短的几个月,甚至可能时间更短。 那听起来其实是合理的,对吧?
程曼祺(嘉宾)
你就说对他们有什么问题对吧?对这些开源公司如果不超越这个现状是否也可以接受?
高洪浩(主播)
是。
程曼祺(嘉宾)
对我觉得这个就是取决于大家怎么去想更强的这个 AGI 之后会怎么到来。 就比如说有一种假设是这样的,像 OpenAI 和 Anthropic 现在都讲很多什么自进化的这种能力。 是。 有可能你自信化到了一定程度之后,人在里面的作用会变小。 如果你用更多 AI 来去优化 AI,其实你的速度是会非常快,你自动化程度很高。 可能它的加速度会越来越大,可能会把后面的人甩得更远,这是其中一种假设。 在这种假设里面,你率先达到某一种状态还是很重要的。 也许你今天看每一次 Anthropic 和 OpenAI 直逼后面的模型领先。 几个月或者几周吧,那也许再过一段时间,他们到了另一个状态之后,这个时间差就没有这么容易缩短了,但这只是一种假设,所以这个东西我觉得也不能满足于说我们现在因为有这种方式,我跟他跟得很紧张就 OK 了。 当然我觉得大家非常依赖于蒸馏可能也只是阶段性的状态,它也只是一种方法嘛,然后你其实可以组合很多方法嘛。
高洪浩(主播)
那我觉得接下来我们可以聊一个话题啊,就站在普通人的视角,对于蒸馏是有非常多的印象,或者是不管是刻板印象也好,或者是很热门的讨论也好。 比如很多人就会觉得蒸馏是一个带有原罪的行为。 为什么会有原罪是指? 原罪可能就是我们刚刚讲的 就是他用了别人的数据 用了别人的数据、超作业等等等等 但他其实我理解我们刚刚聊下来 他就是在一个灰色地带对吧
程曼祺(嘉宾)
我觉得原罪这个词肯定是有点严重了 对我觉得他是个灰色地带吧 他肯定是违反了那些必然模型公司 OpenAI、Anthropic 的用户协议的 但是违反用户协议不一定构成法律上的侵权 这个要看其他的法律规定 另外就是其实我最开始也说了我觉得他们的用户协议本身也就限制的很宽泛。
高洪浩(主播)
你觉得那我们现在来讨论蒸馏这件事情,你个人是觉得我们应该讨论比如说能不能蒸还是说什么样的蒸馏方式是可以被接受的,你会有一条红线吗?

时间轴|约 00:40

程曼祺(嘉宾)
我觉得就是有一些明显是违反现在就全球比较通行的法律法规做法肯定是不太能被接受的。 比如说你用一些黑客攻击的方式你直接侵入其他公司或者实体的系统,你通过黑客的方式去破解思维链什么的,这种是不太能被接受的。 然后你说到就是怎么去考虑蒸馏这个问题。 其实我觉得大部分做模型的人和这些模型公司的人他肯定不会就是单独的去考虑蒸馏这个问题。 他们考虑的问题是我怎么用各种方法去让模型变得更好,以及我构建更长期的能持续做出更好的模型的能力。 他们应该会整体的去考虑这个问题,然后蒸馏是其中的一种可以用的方法。 你用到什么程度,你怎么去用,因为蒸馏有一些不同的操作方式,包括你也可以选择不用,都是不同的选择,对吧? 你可以想象它会有一个比如说一个特别大的控制板上面其实有很多东西都是可以调整,那蒸馏只是其中的一个旋流,我觉得他们会从这个角度去考虑吧。
高洪浩(主播)
另一个就是,那我们看到 OpenAI 和 Anthropic,他们在做预训练的时候也会弄大量的数据,从实体书来也好,从盗版书网站来也好,或者是从各种各样的视频网站拔下来也好,去搞这种爬虫也好。 他们这种行为跟今天我们所讲的蒸馏有本质的区别吗?
程曼祺(嘉宾)
对,我觉得这涉及到现在讨论中的一种常见的对话展开方式。 是。 就是比如说美国公司说中国公司蒸馏。 对。 然后中国公司就会说。 双标。 对,会说你双标。 或者说那你之前也是去用了很多这种可能也没有授权你可以来做模型训练的数据。 甚至有的数据他根本都没买。 对吧,你比如说中国公司去用这些账号,那还是付了钱的。 那个 Anthropic,它最近有一个 15 亿美元的集体诉讼的和解。 那个具体那个案情就是当年它是在一些盗版图书网站下了很多书的。 这个过程它就直接,它就没有给这些书付费。 然后是有很多美国的作家集体诉讼告了它这个事情,就目前已经达成和解了。 就大家会去比较这两种行为吗? 我觉得整体上来说那肯定是双标的。 只不过这两种行为它也不完全一样啊。
高洪浩(主播)
怎么不按学名啊?
程曼祺(嘉宾)
首先它的侵权行为我觉得是不一样的。 比如说 Anthropic 那种我直接就搞到本书。 对,那肯定是侵权的。
高洪浩(主播)
对。
程曼祺(嘉宾)
你就本来你没付钱买书啊,你就侵权。 你就先不说这个我买了之后是否来训练模型啊。
高洪浩(主播)
嗯。
程曼祺(嘉宾)
那买了之后来训练模型是否侵权,就我不知道啊。
高洪浩(主播)
但目前我们看美国的这个加州的法院判这个是不侵权的。
程曼祺(嘉宾)
就是它有一个判例是认为这样就只要你付了钱就不侵权是吗?
高洪浩(主播)
是是是。 但只是州的这个法院怎么判的。
程曼祺(嘉宾)
因为美国是案例法,美国其实它后面的类似的案件,它会去看前面的一些情况是怎么判的。 这个倒是有点价值的回旋标。 那么再想之后,如果说这种方式加州的法院认为它不构成侵权, 对,那其他的公司用 Anthropic 的产出再来提升自己的模型,这是否构成侵权? 这是个很有意思的话题,这个案例挺有意思的。
高洪浩(主播)
我们最后可以做一个预测,你觉得三年以后蒸馏是会像爬虫一样的普遍,几乎无法阻止,还是说可能美国的几家 FromTearLab 最终能够通过所谓的账号体系也好,模型设计也好,甚至是法律手段也好,把它最终给禁止掉呢?
程曼祺(嘉宾)
首先我觉得这个行业可能没法看三年之后的,这个太久了,有 36 个月了。 感觉人间已经变了,不知 AI 已经怎样了。 然后你说就最终这个蒸馏会不会被大幅的压下来? 我觉得这个博弈肯定是会进行的,其实就是你有一些手段,然后我再来反制你的手段,我可能又会找一些新的手段。 所以蒸馏本身它有很多现实约束,它也不太可能肆无忌惮的蔓延啊。 大家也会考虑成本的,你这是多少花钱呢?
高洪浩(主播)
如果蒸馏越来越容易,那今天就是投入几百亿美元训练这种 frontier model 的商业模式会不会有根本性的变化? 因为今天其实已经看到大家对于所谓的斩杀线也讨论的挺热的嘛。
程曼祺(嘉宾)
其实之前 177 期聊 K3 的那期也讨论这个话题。 首先短期内的市场预期是 Anthropic 和 OpenAI 的估值会受一些影响。 甚至有人认为这会冲击他们 IPO 的进程。 但我觉得前提是我们现在只看到此时此刻的前面。 比如说马斯克昨天就是 Glock 4.6 发了之后,他在回复另一个公司的一条推文的时候说 Glock 4.7 会超过现在的所有的模型,但他也补了一句说 Anthropic 的下一个模型可能会非常强,就有可能比如说过了一个月 Anthropic 又发了一个很强的东西,那我觉得大家的预期又会改变哦。 B 站模型公司可能它有一些后手是没有展示的。所以我觉得还比较难说是否就真的冲击了投入很多钱去开发一个非常领先的模型的这个操作。 但是有一件事我觉得也比较明确,就是它是冲击了商业逻辑的,就是像 V4 包括 Grok 其实也是一个性价比很高的模型。 然后有那张很著名的那个斩杀性的图嘛,就是在 V4 还有 Grok 4.6 的下方和右边,就那个区域里的模型都是被斩杀了。 就现在确实有一个问题,我觉得就是说可能对很多任务来说,目前的这一批最强的模型已经很够用了。 比如说我最近见一个应用公司的创始人,就他们也是做那种偏生产力的应用。 他跟我说,可能用户的 10 个任务里面,8 个都能被 DeepSeek V4 Flash 解决。 就当时 Pro 还没有正式发,而且 Flash 就真的非常便宜,速度也比较快。 这个我觉得确实会改变很多商业逻辑的事儿。 他至少会改变很多定价策略吧。而且这也涉及到一个更大的问题,就是说你的智能的供给和需求之间现在是什么关系?目前看起来,其实对很多人的日常的使用来说,可能你的智能过了一个限制之后,它确实就够用了。 我们上次其实讨论姚胜宇那个博客后面也在讨论这个话题。 就是说你 coding 之后你再往白领这种市场去扩散的时候对智能的需求并没有那么大。 我觉得准确描述是这样是说对智能的需求的规模和它的节奏和它的速度有那么快。 其实打问号是最近我然后见一个就平时交流比较多的投资人的朋友。 他也是在想这个事情。 他想的问题就是,我们之前都说,coding 比视频深层大,万一错了了,那这个错了的可能性也是在于,说可能对很多白领的工作来说,就现在这模型真的已经够用了。 你搞更强的模型,这个叫什么杀鸡焉用牛刀,可能你没有用武之地,你就屠龙刀,对,我觉得这可能是比蒸馏更大的一个问题吧,就是你现在智能的供给和需求。 接下来是一个怎么样的匹配,规模上、节奏上。 其实我自己,就上次我们录那个姚顺宇那期的时候,我对这个问题啊,我当时是从个人感受上来说是相对悲观的。 因为我那会儿其实除了用模型做偏 DeepResearch 的工作,我别的工作做的比较少。 但是后来一段时间我用这个 ChatGPT Codex,就它的工作 work 那个功能特别多。 我感觉它确实能让我干很多以前干不了的事儿。 主播是《晚点 LatePost》主席。 所以我觉得这是一个可能在蒸馏之外的很多人现在已经在想的问题了。
高洪浩(主播)
那我们今天其实讨论了非常多关于蒸馏的话题、蒸馏的历史。 它可能不是一个非黑即白的一个概念,对吧? 然后包括我们字节为什么不蒸馏,蒸馏的代价是什么?
程曼祺(嘉宾)
我们字节为什么不蒸馏? OK。
高洪浩(主播)
对,不是我们字节,就是说错了,对。
程曼祺(嘉宾)
没关系,挺有节目效果。
高洪浩(主播)
所以我相信大家对于蒸馏会有一个初步的印象和认知吧。
程曼祺(嘉宾)
对,那今天节目就到这里,最后补充一点就是,因为我们收集的很多关于蒸馏的信息,我们并不是直接做这件事情的从业者。 所以这个文章包括这个播客,我觉得也是更多一个抛砖引玉的。 请不吝点赞 订阅 转发 打赏支持明镜与点点栏目 本期节目就到这里,感谢收听。 如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这也会成为我们节目的一部分,让整个讨论更完整。 你也可以把我们的节目分享给对这个话题感兴趣的朋友,推荐更多你想听的主题和嘉宾。 你可以从小宇宙、苹果 Podcast 等渠道关注《晚点聊 LateTalk》,也欢迎关注我们的公众号《晚点 LatePost》。 下期再见!
我的播客精华 | 12 档节目速读

我的播客精华 | 12 档节目速读

追踪 Lex Fridman Podcast、Huberman Lab、半拿铁、晚点、硅谷101、张小珺访谈、高能量、疯投圈、乱翻书、屠龙大实话、小天章、纵横四海 12 档播客,每期有新节目发布时自动生成中文摘要文章。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel