7月20日 AI创业晚报:推理管线、仿生灵巧手与AI科研现场챕터1×0:07开场与本期范围1:01跨集群推理与稀疏注意力3:59仿生灵巧手与轻量 VLA5:51AI自主科研赛事7:19数学研究与模型快讯0:009:340:07角色一晚上十点,这里是《AI创业播客日报》。今天是二〇二六年七月二十日,下面这期覆盖今天白天到晚上十点之间的新信息。先报一下 X 的读取范围:本轮读取了用户关注列表里的四百个账号,八批全部成功,累计读取七千六百三十三条推文;其中四百零三条落在今天的时间窗,经过 AI、创业、模型、产品、融资和机器人等关键词初筛后,留下了一百五十条相关候选。单个账号最多读取一百条,所以这是一轮全账号覆盖,但不是无限历史回溯。0:42角色二公众号这边,今天窗口里有量子位、机器之心和三十六氪的新文章,Founder Park 和海外独角兽没有同一时间窗内的新增文章进入本期。我们按事件合并,先说推理基础设施,再说机器人和灵巧手,最后到自主科研和一个数学猜想的最新讨论。1:01角色一第一组信息都在模型推理的底层。机器之心今天下午发布了无问芯穹的跨集群异构推理方案,文章标题里写的是「跨集群异构 PD 分离」。这里的 PD,是 Prefill 和 Decode,也就是把提示词处理和后续生成拆到不同的计算资源上。无问芯穹把它进一步拆成三段:先由 P 实例处理输入,再由 RLD 实例接力解码,最后交给 MD 实例完成主要解码。1:27角色二它处理的是一个很实际的传输问题。长上下文请求里,Prefill 产生的 KV Cache 要从一个集群送到另一个集群。文章给出的做法是,RLD 先在本地开始解码,先把跨机房传输的等待时间盖住;等远端 MD 收到缓存后,再通过 Token ID 接力重算。文章把这个方案叫 PDD,也就是 Prefill、Relay Decode、Main Decode。1:51角色一机器之心引用的测试里,在六万四千长度、百分之九十前缀命中的场景,同机房 PD 分离的 P50 首 Token 延迟大约是四点二秒,解码搬到另一座城市机房后大约六点七秒;没有做跨集群优化时,P90 是十八点三秒,P99 是二十九点七秒。文章还给出整体结果:首 Token 延迟降低百分之五十一点五,单 Token 成本降低百分之三十七点五。2:16角色二带宽数字也很直观。文章按一万亿参数级模型估算,单个 Token 的 KV Cache 大约在十到八十 KB 之间,取中间值五十 KB;十万长度请求就是 GB 级缓存。八十个并发、六万四千长度的请求,缓存量大约二十三 GB,传到解码集群需要超过一百八十 Gbps,而经济型跨机房以太网通常是十到一百 Gbps。2:39角色一同一篇文章还提到,真实业务的平均前缀命中率可以达到百分之九十,相关压缩和重算技术最多能把所需跨机房带宽降低十倍。在一组异构部署成本表里,PDD 使用四十三张一种 GPU、三十二张另一种 GPU,再加一条跨机房专线;总硬件成本比同构基线低约百分之三点五到百分之七点一,SLA 内有效吞吐高约百分之二十七点八。3:06角色二同样是今天,机器之心还介绍了腾讯混元团队开源的 HiLS-Attention,中文标题是「在数学上把稀疏注意力做对」。它在三点四五亿到七十亿参数规模上做了验证,短文本困惑度和全注意力几乎重合;在八千长度训练条件下,文章称可以免训练外推到四百万上下文,也就是五百一十二倍。3:29角色一在五十一万二千上下文下,文章给出的 prefill 加速是十三点五倍,单步 decode 加速是十五点七倍;四百万长度外推时,大海捞针准确率保持在百分之九十以上。论文和代码链接也在机器之心文章里,论文地址是 arXiv 上的二六零七点零二九八零,代码仓库是 Tencent-Hunyuan 的 HiLS-Attention。3:51角色二一个方案在搬运 KV Cache,一个方案在减少注意力计算,今天的推理基础设施信息就先合并到这里。下面转到物理世界。3:59角色一三十六氪今天晚上七点发布的文章是「月泉仿生获数亿元融资,仿生拉压体灵巧手万台量产、订单过亿」。文章称,月泉仿生完成了数亿元 Pre-A 加轮融资,仿生拉压体灵巧手已经实现万台量产,累计取得过亿元订单。文章还写到,这家公司做原创仿生底层技术,软硬件全链条自研。4:25角色二量子位今天上午十一点发布的另一篇文章,把视线放到了机器人模型。面壁智能发布了 MiniCPM-Robot 系列,其中 MiniCPM-RobotManip 是一点五 B 参数的通用 VLA 模型,另一个跟踪模型是零点九 B。VLA,就是视觉、语言和动作模型。4:45角色一量子位文章写到,RobotManip 可以控制双臂机械臂完成包括制作三明治在内的操作任务,在 LIBERO、CALVIN 和 RoboTwin 二等评测中,整体表现进入第一梯队;RMBench 约为五十三分。在 H 一百显卡、BF 十六精度下,单次决策延迟约一百二十毫秒。5:05角色二文章还提到,它会把历史观测和此前动作纳入判断,使用视觉 Token 压缩和流式计算处理更长的历史信息。面壁智能的 OpenBMB 账号也在 X 上转发了这次发布。这个账号的个人简介是「Open Lab for Big Model Base」,定位是构建通向 AGI 的基础模型和系统;它在回复中说,模型可以本地运行,但最终部署仍取决于具体机器人平台、传感器、控制系统和适配工作。5:32角色一所以这一组只记录两条新增事实:一家公司披露了灵巧手的融资、量产和订单,另一家公司发布了轻量通用 VLA 及其部署信息。来源分别是三十六氪、量子位和 OpenBMB 的 X 帖子,链接会按机器人话题列在节目正文。5:51角色二接下来是上海的 AI 自主科研赛事。量子位今天晚上七点四十一分的文章写到,七月十七日至十八日,二〇二六世界人工智能大会科学智能开放论坛举行了 AI4S 智能体 CNS 挑战赛。文章称,这是全球首个自主科研智能体赛事,考核的是科研智能体完成真实任务的全流程能力。6:13角色一创新赛道的任务包括高通量药物虚拟筛选、靶向分子设计、蛋白质构象系综生成和神经算子自动改进。其他算法赛道还包括电力市场交易、可控核聚变、生物结构预测和古文字识别;中学组把 AI 放进了古书画保护场景。6:31角色二文章举了一个参赛系统:中科院上海药物所和浙江大学组成的「可以的」团队,做了 MidSummer 自治科研智能体。系统采用双层协作架构和三层韧性自动化体系,用「假设、实验、反思、追问、修正」的循环推进任务。文章举例说,系统在多次动力学模拟失败后,识别出全原子侧链冲突,把优化重点转到侧链物理修复。6:55角色一赛事还为不同任务接入了不同资源。生物结构预测使用 RNA 和蛋白质结构方向的数据;电力市场交易接入蒙西电力交易中心的一手市场出清数据和气象预测数据;可控核聚变使用新奥玄龙五十 U 球形环装置的高保真仿真平台;古文字识别则使用复旦大学和上海博物馆、湖南省博物馆开放的甲骨文、金文和简牍样本。7:19角色二最后是一条机器之心今晚九点二十六分发布的数学消息,标题是「把张益唐坑苦的雅可比猜想,被 Fable 五证伪了?」文章说,雅可比猜想由奥托·海因里希·凯勒在一九三九年提出,核心问题是:一个多项式映射如果雅可比行列式处处等于同一个非零常数,是否就一定全局可逆。7:41角色一文章转述,一位 Anthropic 数学家在 X 上发文称这个猜想是错的,并给出从复三维空间到复三维空间的一个多项式映射:雅可比行列式恒等于负二,但三个不同点被映射到了同一个点。文章还提到,Jared Duker Lichtman 转发并拆解了这个反例,相关帖子浏览量超过五百万;截至文章发布时,结果还没有正式同行评审,多位数学家用 Wolfram Alpha 复算了关键数值。8:10角色二所以在节目里我们只报到这里:有一个具体反例被公开,有人复算了关键数值,但文章同时写明还没有正式同行评审。原文链接会放在「数学研究」这一组,不把它说成已经完成的定论。8:24角色一再补一条来自 X 的研究快讯。机器之心的 X 账号,个人简介写的是「中国领先的 AI 和机器学习媒体与信息提供者」,它介绍了新加坡国立大学和 TikTok 研究者的 CAMEL 框架:先用一个单 Token 偏好决策快速处理,只有低置信度样本才进入反思步骤;帖子给出的平均准确率是百分之八十二点九,比此前最好结果高三点二个百分点,并称用十四 B 模型超过了七十 B 模型。8:53角色二这期的内容就到这里。今天 X 关注源实际覆盖四百个账号、读取七千六百三十三条,窗口命中四百零三条,相关初筛一百五十条;公众号和公开文章按话题合并后,留下了推理基础设施、机器人、AI 自主科研和数学研究四组。9:11角色一三十六氪、量子位、机器之心以及本期实际引用的两条 X 帖子,都会在节目正文里按话题列出标题或账号和链接。这里是《AI创业播客日报》,明早九点再见。