7月16日 AI 创业早报:开放权重模型、工厂机器人和安全红队Capítulos1×0:07片头:先说窗口0:52第一章:开放权重不等于低成本2:59第二章:机器人融资开始买真实工位5:04第三章:安全红队变成模型训练的一部分7:01第四章:苹果备案,DeepSeek 传闻,都要把语气放准8:34第五章:企业 Agent 先改组织,再改软件10:04收束0:0012:020:07host早上好,这里是 AI 创业播客日报。今天先把一件容易被忽略的事说清楚:我们这期扫描了 @fitzroy4910 账号授权的全部三百九十四个 X 关注账号,八批读取全部成功,一共读到六千零三十一条推文,其中三百五十五条落在昨晚十点到今天早上九点的北京时间窗口里,按 AI、创业、产品、模型和机器人等方向初筛出一百七十五条相关内容。0:34cohost这个统计也有一个边界。每个账号这次最多读取一百条,窗口里没有失败账号,所以今天的覆盖是三百九十四个账号全覆盖,但不是承诺把某个账号更早的历史无限往前翻。我们把重复转发合并,只留下能改变判断的几条。0:52host第一条,Thinking Machines Lab 在七月十五日发布了首个开放权重模型 Inkling。官方给的规格很大,总参数九千七百五十亿,单个 token 激活四百一十亿,最长上下文一百万 token,预训练使用了四十五万亿 token,原生处理文本、图像和音频,训练数据还包含视频。1:13cohost听起来像一张参数海报,但这次更值得创业者看的,是它怎么被交付。模型用 Apache 2.0 许可发布,权重可以下载,也可以在 Thinking Machines 的 Tinker 平台上做微调。官方还给了一个模型自己写微调任务、运行任务、评估结果的演示。它没有把自己包装成所有榜单第一,而是明说目标是做一个适合定制的通用底座。1:37host这点很关键。Reuters 的报道也提到,Inkling 的整体性能还没有超过最强的闭源模型,但在智能体相关任务上有竞争力。换句话说,开放权重的卖点不只是「我也有一个模型」,而是让开发者能把模型改成自己的工作流组件。1:54cohost不过开放权重和低成本是两回事。模型卡写得很直白,BF16 版本需要至少两 TB 的聚合显存,量化后的 NVFP4 版本也要六百 GB 左右。你可以下载权重,不代表一台普通工作站就能把它跑起来。对创业公司来说,真正要算的是部署成本、延迟、微调成本和客户愿不愿意把数据交给你。2:17hostX 上的生态响应也很快。机器学习社区有人转发了 Thinking Machines 的发布,vLLM 和 PyTorch 生态在当天就出现了对 Inkling 的支持和推理优化讨论。这个信号比单纯的转发量有用,因为它说明模型发布和开发者可用之间的距离正在缩短。2:35cohost所以给做模型应用的朋友一个早晨版判断:不要只问「这个模型比哪个模型强」,要问三件事。第一,客户需要哪些输入模态。第二,哪些行为要靠微调而不是提示词。第三,客户能接受多少 GPU 和延迟。开放权重把选择权往下游推了一步,但也把账单和运维责任一起推了下来。2:59host第二条是 Walden Robotics。公司七月十五日从隐身状态出来,官方公告说完成三亿美元融资,估值十一亿美元,Toyota 和 Deviation Capital 联合领投,NVIDIA、Boeing、Samsung Ventures、Prologis Ventures、CoreWeave Ventures 等机构参与。3:17cohost数字很大,但最值得说的不是估值。Walden 的官方说法是,他们把通用机器人部署到制造和物流环境里,和人一起做真实工作。公司还说,团队从 Toyota Research Institute 出来后,二月份开始就在北美一家 Toyota 工厂做生产工作,从第一次试点到真实作业用了不到两个月。3:40host这里要把「官方声称」和外部验证分开。我们能确认的是公告里的融资、公司定位和部署描述,不能因为一篇公司新闻稿就替它证明产能、良率或者客户回本。可是从融资结构看,Toyota 既是投资方,也是工厂和产业链资源的提供者,这比一段机器人完成复杂动作的视频更接近创业公司的商业验证。4:03cohost对,机器人公司的销售不是把机器送到门口就结束了。要持续拿到订单,得处理工位改造、异常恢复、人员协作、维护和责任边界。Walden 讲的是 Large Behavior Models,也就是让机器人通过真实操作不断学习新任务。这个故事如果成立,数据就不只是训练集,而是每天生产现场里的服务资产。4:27host这也是今天和昨天机器人话题的区别。昨天我们聊的是机器人能不能长时间进厂,今天新增的是资本怎么为一套「模型加硬件加现场团队」的交付系统定价。创业者如果只擅长模型演示,不擅长工厂里的流程、采购和售后,融资金额越大,落地压力反而越快到来。4:47cohost早上给硬件创业者留一个检查表:融资材料里别只放成功率和视频,要放每个工位的部署时间、异常人工接管次数、每小时有效产出,以及客户愿意为哪一个环节付钱。机器人能不能做事,最后要落到生产节拍和现金流上。5:04host第三条来自 OpenAI。七月十五日公开了 GPT-Red 的介绍。这是一个专门做自动化安全红队的内部模型,目标是规模化寻找提示注入漏洞,再把攻击样本用于后续模型训练。5:18cohost它的训练方式很像一场不断加码的攻防游戏。GPT-Red 负责发起攻击,防守模型负责抵抗攻击并完成原始任务,双方用自博弈强化学习一起变强。OpenAI 的官方页面说,在一个新的间接提示注入场景里,GPT-Red 的攻击成功率是百分之八十四,人类红队员是百分之十三。5:39host还有一个很容易被忽略的结果:OpenAI 说,他们把 GPT-Red 生成的攻击直接放进 GPT-5.6 的训练流程后,最难的直接提示注入基准上,失败次数比四个月前的最佳生产模型少了六倍。这里仍然是 OpenAI 自己公布的结果,不等于所有真实环境都已经解决,但它把安全从发布前的一次检查,变成了持续训练能力。6:03cohost而且攻击面已经不在聊天框里了。浏览器、邮件、代码仓库、本地文件、工具返回值,任何一个外部内容都可能夹带一条诱导模型越权的指令。Agent 产品如果只测「模型会不会回答错」,没测「它会不会被外部内容带着做错事」,那安全评估少了一大块。6:22hostLangChain 在窗口内的一条 X 讨论也把企业治理拆得很具体,身份认证、审计日志、速率限制、故障回退和集中式花费控制,都要一起设计。对创业公司来说,卖 Agent 时最好把这些能力做成产品面,而不是等客户出事故后再补一个安全白皮书。6:40cohost我会把 GPT-Red 这条新闻翻译成一个产品问题:你的 Agent 每次执行任务,能不能留下可复盘的攻击路径和权限记录?如果不能,出了问题你连「模型错了」还是「工具给了恶意上下文」都分不清。安全团队和产品团队,得从上线前的评审变成同一条交付链。7:01host国内早上的信息有两条。36 氪八点零六分的早报写到,国行苹果 AI 功能完成备案,苹果智能大模型接入阿里千问。Reuters 进一步报道,中国网信部门确认 Apple Intelligence 已完成在中国 iPhone 上使用的注册,阿里称 Qwen 会集成到中国市场的 iPhone、iPad、Mac 和 Vision Pro 上,百度也在参与相关合作。7:25cohost但备案不是上线。Reuters 明确说,监管部门没有给出具体上线日期。所以今天不能把「完成注册」写成「国行设备已经能用」,这两个动作中间还隔着产品发布和实际开放。7:38host36 氪同一篇早报还提到 DeepSeek 新融资和潜在 IPO。Reuters 的口径是,两名知情人士称,DeepSeek 可能按约五千亿元人民币、也就是七百四十亿美元左右估值筹集新资金,并讨论上海科创板 IPO;这些计划还在早期,条款和时间表都可能变化。7:58cohost这条和前几天讲过的 DeepSeek 估值讨论有新增,但不能当成已经递表。创业者和投资人听这种消息,先分三层:已经完成的上一轮融资,消息人士说的新一轮估值,以及仍在讨论中的上市时间。资本市场的标题很快,公司的法律文件通常没那么快。8:17host这两条放在一起,反而能看出一个变化。模型公司一边要通过监管和设备入口进入真实用户,一边要通过融资和资本市场继续买算力、招人和做基础设施。产品准入和资本准入,正在同时成为 AI 公司的经营问题。8:34host最后补一条来自 Box CEO Aaron Levie 的 X 长文。他在和企业 IT 负责人交流后总结,Agent 落地最大的难点之一仍然是变更管理,很多流程要先改成适合自动化的工作方式;企业也越来越多地把工程师嵌进业务团队,去做内部的 FDE,也就是现场交付型工程。8:55cohost他还提到几个很实在的细节:跨部门 Agent 会遇到数据建模和权限问题,企业开始按任务把工作路由给不同价格的模型,多模型系统和开放权重模型仍然更多处在试验阶段。这个判断和今天的 Inkling 正好接上,模型选择正在变成采购和经营问题,不是工程师个人的偏好。9:16host所以今天的执行建议可以很短。先挑一个有明确结果的工作流,给 Agent 单独的身份和最小权限;再记录每次调用的模型、工具、人工接管和成本;最后把成功标准写成可复测的任务,而不是让团队用「感觉更聪明」做验收。9:34cohost如果一家公司现在还在讨论要不要买一个最强模型,可能还没走到最关键的一步。更关键的是,这个 Agent 到底谁负责,能看什么数据,花多少钱,失败以后谁接手。模型会继续变,但这些问题不会自己消失。我会把它做成一张最小经营表:任务名称、调用模型、工具权限、每次成本、人工接管点和最终结果,连续跑两周再决定要不要扩大范围。没有这张表,团队很容易把一次漂亮的 Demo 当成稳定业务。10:04host今天的主线就三句话:开放权重模型把定制权和基础设施账单一起交给开发者,机器人融资开始围绕真实生产工位,自动红队把安全推进到模型训练内部。苹果备案和 DeepSeek 融资传闻,则提醒我们把注册、上线、融资和 IPO 逐个动作说清楚。对创业团队来说,接下来最值得做的不是再写一页趋势判断,而是把这几件事各自对应的负责人和证据字段补齐:模型看成本曲线,机器人看工位产出,Agent 看权限日志,资本故事看正式文件。预算也要拆开看,模型调用费、工具服务费和人工复核费分别记账,不能用一个总额掩盖哪个环节在烧钱。先选一个小范围流程跑满一周,给它设定成本上限和人工接管上限,超过任意一条就暂停扩张,回到失败样本里找原因。这样做出来的数字,才足以支持下一轮采购、融资或产品取舍。11:01cohost本期内容覆盖北京时间七月十五日晚上十点到七月十六日早上九点。节目正文和 show notes 末尾列出本期实际使用的 X 帖子、公众号文章和网页来源。早上通勤路上先记住一个问题:你的 AI 产品下一次增长,究竟需要一个更大的模型,还是一套能在真实环境里负责到底的交付系统?如果答案是后者,今天就先找一个真实工作流,记下它的成本、权限和失败次数,下一期再看这三个数字有没有变好。下周复盘时,再把人工接管时长和客户是否愿意继续使用补上,这样你看到的是业务变化,不只是模型排行榜变化。把这五个数字放在同一张周报里,团队才知道该继续加模型、加工程,还是先停下来修流程。七天后再看一次,重点是人工接管有没有减少。