MatBrain:两个模型分工,科研智能体怎样把结果验回来?Chapters一个科研智能体生成三万个晶体结构,忙了四十八小时,最后留下三十八个候选。0:00三万个结构,留下了什么0:45为什么要让模型分工2:31工具结果怎样改变下一步3:51筛选漏斗里的真正门槛5:23怎样读准确率和成本7:21从研究设计走向产品判断0:00 / 9:071×0:00思辨播客男声一个科研智能体生成三万个晶体结构,忙了四十八小时,最后留下三十八个候选。0:06思辨播客男声你可能先注意到生成速度,但我更想知道,剩下的那些结构为什么被淘汰了。0:11思辨播客男声这里是 AI 前沿解读。0:13思辨播客男声九月十日,中国科学院深圳先进技术研究院介绍了一项名叫 MatBrain 的研究,中文叫材智云脑。0:21思辨播客男声研究团队说,相关论文当天在《自然·机器智能》在线发表。0:25思辨播客男声这个智能体把科学推理和工具执行交给两个模型,再让工具返回的结果推动下一轮判断。0:31思辨播客男声我们就沿着那三万个结构走一遍,看看两个模型各自解决了什么问题,哪些环节仍然需要人。0:38思辨播客男声下面涉及的实验数字,来自研究团队的官方介绍和配图;我们会把团队披露与产品分析分开。0:45思辨播客男声你可以想象一个材料研究任务:研究人员想找到具有某种性质的晶体,先要提出结构,再检查结构是否合理,最后决定哪些值得做实验。0:54思辨播客男声晶体结构描述的是原子怎样排列。0:57思辨播客男声原子的种类对了,排列方式不对,材料的性质也可能完全不同。1:01思辨播客男声科研人员因此需要的不只是一段解释,还需要能被计算程序读取、能接受约束检查的具体结构。1:09思辨播客男声按研究团队的描述,通用模型在这类工作里会遇到两组不同的难题。1:14思辨播客男声模型做科学判断时,可能缺少连贯的领域知识,也可能没有守住物理化学约束。1:21思辨播客男声模型调用工具时,则可能选错程序、填错参数,或者在多步任务中途停下来。1:27思辨播客男声前一组问题需要专业知识,后一组问题需要执行反馈。1:31思辨播客男声团队把 MatBrain 拆成了 Mat-R1 和 Mat-T1。1:35思辨播客男声为了方便听,接下来我们分别叫它们推理模型和执行模型。1:39思辨播客男声推理模型有三百亿参数,执行模型有一百四十亿参数,这个分工和规模都画在团队公开的框架图里。1:46思辨播客男声参数可以理解成模型在训练中学到的大量数值设置,它们共同决定模型怎样处理信息。1:52思辨播客男声三百亿加一百四十亿,显然也不是随便一台电脑就能轻松运行的小软件。1:58思辨播客男声这里的轻量,描述的是团队选择的相对规模,不能直接理解成手机上就能部署。2:04思辨播客男声团队没有只给同一个模型换两个角色名字。2:07思辨播客男声团队给推理模型整理和关联材料知识,再把推理能力训练进去。2:12思辨播客男声执行模型则把科研工具当成训练环境,利用执行过程的反馈学习怎样调用工具。2:18思辨播客男声我的理解是,这种设计承认了两种工作有不同的训练目标。2:23思辨播客男声科学判断要守住约束,工具操作要能应对不同返回结果,团队尝试分别培养这两种能力。2:31思辨播客男声现在让我们看一次任务怎样流转。2:34思辨播客男声框架图里,用户指令先进入工具调用这一侧,经过问题分析和工具执行,再把结果交给知识推理这一侧。2:42思辨播客男声推理模型分析结果,判断是否需要继续调用工具;如果需要,任务就返回执行侧。2:48思辨播客男声两个模型依靠共享状态,把生成、验证、反馈和再执行连起来。2:55思辨播客男声你可以把共享状态想成两个人共同更新的一本实验记录。3:00思辨播客男声记录里应该能看出,当前检查的是哪个结构,哪一步计算已经完成,哪些结果还没有得到验证。3:07思辨播客男声这个实验记录的说法是帮助理解的类比;真正的系统怎样保存字段,需要看具体实现。3:14思辨播客男声假设执行模型拿回一个计算失败的结果,推理模型就不能把那个结果当成合格材料的证据。3:19思辨播客男声假设程序顺利运行,但结果违反了材料约束,系统也需要改变下一步计划。3:25思辨播客男声这两种失败很容易混在一起。3:27思辨播客男声程序正常退出,只说明程序完成了一次运行;研究结论是否成立,还要另外检查。3:33思辨播客男声对科研智能体来说,反馈的价值就在这里:工具可以给模型一个理由,让模型放弃刚才那个看上去很漂亮的想法。3:41思辨播客男声但如果两个模型共享了一个错误假设,它们也可能相互强化那个错误。3:45思辨播客男声多一个模型本身没有提供独立证据,外部计算和真实实验才有机会打破这种循环。3:51思辨播客男声团队的案例图,恰好展示了外部检查怎样改变候选集合。3:55思辨播客男声那三万个结构先接受组分一致性和价态合理性检查,再去除重复结构。4:01思辨播客男声组分检查关心材料用了哪些元素,价态检查关心元素的电荷关系是否合理。4:06思辨播客男声系统随后检查结构合理性、结构稳定性和电子特性,最后把候选拿去跟数据库比较,检查新颖性。4:14思辨播客男声我们不用记住每一层数量,只看淘汰最明显的地方。4:18思辨播客男声在结构稳定性检查之前,图上还有一万零一百二十八个结构;经过这一步,只剩四十二个。4:25思辨播客男声这个变化比最终留下多少个,更能说明筛选的作用。4:29思辨播客男声一个结构能被生成出来,甚至通过前面的规则检查,也不代表它在后续计算标准下足够稳定。4:37思辨播客男声最后的数据库比较,又把四十二个缩小到三十八个候选。4:40思辨播客男声团队说,系统在四十八小时内完成这个过程,并指导实验开展。4:45思辨播客男声这里的三十八个是新候选材料,不能读成三十八种已经合成成功、已经证明有商业价值的新材料。4:53思辨播客男声数据库中没有相同记录,也有它自己的范围:数据库覆盖了什么,决定了新颖性检查能排除什么。5:00思辨播客男声团队公开介绍没有逐项交代这三十八个候选的实验结果,所以我们不把筛选完成写成实验完成。5:06思辨播客男声我认为,这个案例目前最有说服力的地方,是系统能把大规模生成接到多层筛选上,让不合格的候选及时退出。5:16思辨播客男声至于筛选到底能节约多少现实研发时间,还要把计算资源、实验成功率和人工投入一起测出来。5:23思辨播客男声你可能也看到了这项研究的另一个醒目数字:准确率提升百分之六十六。5:28思辨播客男声这个数字需要连着比较对象和指标一起读。5:31思辨播客男声官方文字把结果概括为,相较于 GPT 五等主流模型,材料预测和结构设计任务的预测准确率提升百分之六十六。5:40思辨播客男声但配图的标题说的是,相比 DeepSeek R1 等模型,综合准确率提升百分之六十六。5:46思辨播客男声文字和图里的比较对象没有完全对齐,所以我不会把这个综合数字讲成对每一个模型、每一项任务都提升同样多。5:55思辨播客男声具体的指标更容易理解。5:57思辨播客男声在配图的电荷中性满足率这一行,ChatGPT 五是百分之五十九点五,MatBrain 是百分之八十六点五。6:04思辨播客男声两者相差二十七个百分点。6:06思辨播客男声电荷中性检查关注正负电荷能否抵消,它衡量的是一种具体约束的满足情况。6:12思辨播客男声这项提高值得关注,但它不是实验合成成功率,更不是整个科学研究的正确率。6:17思辨播客男声图里还有化学式匹配、原子数匹配和其他结构指标,这些指标帮助定位模型到底在哪些环节做得更好。6:25思辨播客男声团队同时披露,硬件部署成本降低了百分之九十五以上。6:29思辨播客男声这个说法的对象是硬件部署成本,我们不能顺手把它改成每项科研任务的总费用降低同样多。6:36思辨播客男声一个系统还会消耗工具计算时间、数据库资源和人工复核时间。6:41思辨播客男声模型之间交接信息、反复重试,也可能增加运行开销。6:46思辨播客男声如果要判断两个模型是否值得采用,测试就需要把这些费用放回同一个任务里算。6:51思辨播客男声还有一个因果问题:现在看到的收益,究竟来自专业训练、工具设计,还是双模型分工本身?6:58思辨播客男声要把这几种贡献分开,需要在可比的条件下逐项去掉组件,再看结果怎么变。7:06思辨播客男声这种测试叫消融实验,你可以理解成每次少装一个零件,检查少了谁,性能才真正下降。7:14思辨播客男声官方介绍给了我们设计思路和案例,但这些材料还不足以让我们认定,换成两个模型就一定优于一个模型。7:21思辨播客男声那么,这项研究对不做材料实验的人,有什么实际意义?7:26思辨播客男声如果你平时用 AI 整理资料或做内容,MatBrain 提醒我们留意一种区别:模型给出的答案,和经过工具核验的答案,是两个不同阶段的产物。7:36思辨播客男声你可以要求助手给出引用和核验过程,也可以检查那些引用是否真的支持结论。7:42思辨播客男声一个模型说它检查过了,并不会自动增加证据。7:46思辨播客男声如果你是独立开发者,这套分工值得当成一个可以测试的方案。7:49思辨播客男声假设你在做数据分析助手,可以让执行环节返回查询、数据版本和运行结果,再让分析环节根据这些记录写结论。7:59思辨播客男声这是从研究设计推导出的产品示例,不是 MatBrain 已经证明过的应用效果。8:04思辨播客男声你可以用同一批任务比较单模型和双模型,记录谁做完了、谁需要重试,以及人最后花了多久检查。8:12思辨播客男声如果大部分任务一次调用就能完成,新增的交接步骤可能只是额外成本。8:17思辨播客男声如果执行经常失败,而且失败结果确实会改变分析方向,分工才更有机会带来收益。8:24思辨播客男声如果你在准备 AI 产品经理岗位,这个案例值得追问的就是验收标准。8:28思辨播客男声在产品界面里,候选已生成、计算已通过、实验待验证,应当是不同的任务状态。8:34思辨播客男声用户看到一个完成标记时,需要知道究竟完成了哪一步。8:38思辨播客男声开发团队也需要保留候选被淘汰的原因,否则失败过程消失以后,团队很难判断系统是真会筛选,还是碰巧留下了几个答案。8:48思辨播客男声MatBrain 把这个问题摆得很具体:三万个结构能不能变成有用的科研结果,取决于后面的检查能排除多少错误,又保留多少真正值得实验的候选。8:58思辨播客男声两个模型的分工提供了一种实现方式,验证过程决定了这种方式有多少价值。9:03思辨播客男声我们下期再见。