从蒸馏到合成数据到 RSI:模型竞争的下一个焦点

从孟繁青谈后训练、合成数据、RSI 与蒸馏出发,帮助 AI 产品团队判断模型厂之外的创业切口、数据资产与评测循环。

从蒸馏到合成数据到 RSI:模型竞争的下一个焦点
0:0016:42
这期从《42 章经》对谈 Evolvent AI 联创孟繁青出发,追问一个比模型榜单更实际的问题:当训练和推理越来越像基础服务,AI 创业公司的切口还在哪里?答案落在评测环境、合成数据、研究轨迹,以及能让模型持续改进的任务循环上。1

本期听什么

  • 为什么后训练背景的人更容易出来创业,创业切口怎样和模型厂保持正交。
  • Bench 如何从「做一道数学题」变成模拟飞书、Notion 等软件的长程工作环境。
  • 国内模型的相对长板是否在预训练架构,而后训练的数据积淀为何更难追上。
  • R S I、Self-Evolving 和 Auto-Research 共同指向什么,应用团队是否仍需要自己的 Harness。
  • 数据为什么从原始文本、专家标注走向 Agent 交互轨迹,下一波机会为何可能是 R S I 数据。
  • 蒸馏怎样作为加速手段使用,又怎样避免只复制别人的输出分布。

五个判断

1. 后训练创业的机会,是把任务变成环境

训练服务可以一键提交,但数据是否值得提交、轨迹是否真的带来提升、评测有没有被钻空子,仍然需要研究员的判断。新的 Bench 也不只是出题和对答案,而是让 Agent 在一套模拟工作软件里完成长程任务。
对创业团队来说,值得卖的可能是一套可运行的工作环境:它有权限、工具、状态和失败条件,客户可以反复验收,模型也可以在里面反复练习。环境和评测不是模型的包装,而是产品本身的一部分。

2. 国内模型的相对长板,可能来自资源约束下的架构创新

孟繁青把这视为个人判断,而不是行业共识。他认为,国内模型厂在资源较少的情况下,被迫寻找更省计算的预训练架构;但后训练的数据积淀,更依赖时间、人力和组织体系,短期不容易补齐。1
应用团队不需要照搬模型实验室的战场。更实际的检查是:自己有没有在具体任务上留下独有的失败案例、评测数据和人工修正;模型换掉以后,这些资产是否仍然有效。

3. R S I 不是一只新模型,而是一条能回到结果的循环

节目把 Self-Evolving、R S I 和 Auto-Research 归到同一种形式:给模型一个环境和目标,让它持续操作,拿到反馈,再修改下一轮。没有可运行的环境、稳定的评分和回溯路径,「让模型自己变强」就只是口号。
这也是为什么应用层仍可能需要自己的工作流。通用编码场景的 Harness 会越来越简单,但垂直领域可以用更小的开源模型,配合隐私可控、成本更低的流程。关键不是调用最强模型,而是能否稳定完成真实任务。

4. 数据的价值,从样本转向可复用的研究轨迹

原始文本、专家标注和 Agent 交互轨迹对应不同训练目标,并不是简单的替代关系。真人数据有噪声和合规边界,合成数据可以控制环境和评分,但也会带着生成者自己的偏差。
孟繁青提到的「R S I 数据」,是让一个模型去后训练另一个小模型,并把小模型效果提升的完整过程留下来。这里的价值不在一条答案,而在任务、环境、模型版本、成本、反馈、失败原因和最终提升能否复现。
Evolvent AI 的公开项目 RSIBench-Data 将自己描述为面向长程 Agent Benchmark 的预算感知合成数据生成与后训练基础设施,流程包括生成训练数据、运行 LoRA SFT、评估 checkpoint,再选择最终提交。2

5. 蒸馏是加速器,不是模型竞争的决定性答案

合成数据可以借助外部模型在环境里探索,但真正决定质量的,是环境是否足够复杂、任务评分是否正确、轨迹里有没有可学习的东西。简单任务上的硬蒸馏更像复制答案;有复杂环境和可靠评分的合成轨迹,才更接近研究数据。
孟繁青认为,蒸馏能加速国内模型追赶,却不是国内模型变强的决定性因素。预训练架构、训练数据和组织能力仍然决定长期上限。对创业团队而言,蒸馏可以减少冷启动成本,但不能替代自己的研究问题和评测体系。

一周内可做检查

  1. 挑一个现在依赖研究员手动推进的任务,写清楚环境、目标和结束条件。
  2. 记录一次训练或评测的成本、耗时、模型版本和失败原因,不只看调用量。
  3. 为主指标配一条独立检查,专门找作弊、投机和跨任务退化。
  4. 比较最强模型和便宜小模型在真实工作流里的差距,把隐私、延迟、价格和权限一起算。
  5. 假设模型 API 价格明天降到接近免费,检查团队还留下了哪些环境、任务数据、失败经验和客户流程。

带回团队的问题

  • 我们卖的是模型能力,还是模型在一个具体环境里完成任务的能力?
  • 我们积累的是答案,还是可复现的研究轨迹?模型换掉以后,哪些资产还能继续用?
  • 哪个指标能证明系统真的变好了,哪个检查能证明它只是找到了评分漏洞?
  • 如果只依赖外部模型的输出,团队还会不会提出自己的问题,发现自己的 insight?
  • 产品、工程和研究之间的反馈,要多久才能回到同一个人的手里?

素材边界

原节目没有提供官方完整逐字稿。本期使用节目公开的完整音频,并完成全量语音转写;嘉宾原声片段均从同一份原始音频中按时间线截取并对齐。主持人的结构化旁白是面向 AI 产品创业者的二次整理,不把整理稿冒充原节目逐字稿。原节目发布于 2026 年 8 月 8 日,来源为《42 章经》在小宇宙的本集页面。1
七档AI 创业者精选播客缩短版

七档AI 创业者精选播客缩短版

七档头部播客的 AI 创业者视角精炼版,每集覆盖原集核心观点并穿插嘉宾原声,约 20 分钟

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.