7月10日 AI 创业晚间对谈:新模型混战、Agent 上班和世界模型覆盖范围1×0:26模型发布混战2:48Meta 与成本竞争4:14Agent 进公司5:55世界模型和具身智能7:20融资、开源模型和芯片9:15创业者清单0:009:300:00男主播今天晚上这期,先把范围说清楚:我们按北京时间 7 月 10 日早九点到晚十点做晚报。X 关注源这次覆盖了三百九十三个账号,读取到六千零一十六条推文,窗口内二百八十八条,筛出一百七十三条 AI 和创业相关内容。单账号最多拉一百条,所以高频账号仍可能有边界。海外独角兽今天这个窗口没有新文,其他几个公众号和公开网页有增量。0:26女主播今天最热的主线很明显,模型厂商又开始一起上桌。OpenAI 把 GPT-5.6 全量推出来,Sol、Terra、Luna 三档模型配上 ChatGPT Work;Meta 也发了 Muse Spark 1.1,还第一次把模型 API 当成正式生意来推。听上去像发布会互相撞车,但真正该看的不是谁口号更大,而是谁能把 Agent 的成本、权限和工作流讲清楚。0:50男主播OpenAI 这次的重点是把 Codex 能力塞回 ChatGPT Work。Reuters 的报道说,这个新 Agent 面向白领用户,把聊天、编码、文档、演示和网站生成放到同一个入口里,先给 Pro、Enterprise 和 Edu 用户用,再逐步扩到 Plus 和 Business。OpenAI 官方页强调 GPT-5.6 是他们当前最强模型,也把效率放在很靠前的位置。1:18女主播X 上的反馈挺有意思。邵孟把这次组合拆成三档模型、五档推理强度、两档速度,算下来在 ChatGPT Work 和 Codex 里有三十种搭配。他提醒不要每个任务都拉满,应该先用同等或低一档推理强度试,尤其要清掉那些多年堆出来的提示词债务。这个说法对团队很实用,模型强了以后,不是提示词越长越安全。1:43男主播对,授权边界反而更重要。邵孟还提到,GPT-5.6 更主动,更会推断意图,但修改、构建、外部写入、删除、发布这些动作必须分清楚。创业团队如果把 Agent 接进生产系统,提示词不是文案,它已经变成安全接口的一部分。2:01女主播另一边,大家也在吐槽用量。有人说 ChatGPT 和 Codex 合并以后,普通用户可能一不小心把 Plus 额度烧光;还有人开玩笑说,台风来了别人囤菜,他囤 Codex 重置。笑归笑,问题是真的:下半年很可能从 tokenmaxxing 变成 costmaxxing,财务同事会开始问,单个工程师一个月烧掉两三倍工资的 token,到底换回了多少交付。2:26男主播Meta 的 Muse Spark 1.1 也值得单独讲。Meta 官方把它定义成面向 agentic tasks 的多模态推理模型,强调工具使用、计算机使用、编码和多模态理解。搜索结果和 X 现场反馈都显示,Alexandr Wang、Garry Tan 这些账号在推它的 OpenClaw 和 harness 表现,SemiAnalysis 也给了相当正面的信号。2:48女主播这里的看点是 Meta 不再只是开源大模型的那个 Meta,而是想把模型 API 做成真正收入来源。Garry Tan 转发的说法里,Meta AI 负责人讲这个 API 不是学习项目,而是真业务。Kimmonismus 的评论也直白:Meta 和 SpaceXAI 都在把成本效率摆到台面上,Anthropic 和 OpenAI 不可能只靠品牌溢价舒服太久。3:12男主播不过我们要小心,不把 X 上的兴奋当结论。Muse Spark 1.1 今天有官方发布,有开发者试用,也有高赞讨论,但它在不同任务里的稳定性还需要更多公开评测。创业者现在能得到的结论是:模型供应商变多了,路由层、评测层和成本控制层的价值更高了。3:32女主播这就接到 Sierra。Bret Taylor 今天发文说,Sierra 把公司内部 Agent 统一成 Pinecone,一个 Slack handle、一个 URL、一条任务线。Sierra 博客里给了两个很硬的数字:Pinecone 从三月第一次 commit 以来,跑了超过七万五千个 session,服务六百多人,现在有七成 PR 是通过它打开的。3:52男主播Sierra 这篇比一般 Agent 案例好,是因为它不只说提效。它讲了几个具体教训:角色型 Agent 太多会让员工记不住,所以收敛成一个 Agent;真正瓶颈已经不是模型智商,而是公司上下文;系统记录仍然放在 GitHub、Salesforce、Linear 这些后端里,Agent 做跨系统界面。这个架构选择很现实。4:14女主播我喜欢它承认一个尴尬点:session 数、tool call 数都只是活动量,不是结果。Pinecone 生成七成 PR 听起来很猛,但团队下一步还得证明客户问题是不是更快解决、合同是不是更快推进、员工是不是少加班。很多创业公司现在缺的就是这层结果度量,不是再接一个模型。4:33男主播公众号这边,36氪今天有一篇讲 FDE,也就是 Forward Deployed Engineer,字节和阿里云都在高薪招这类人。这个岗位火起来,其实和 Sierra 的经验是一回事:AI 产品卖给企业以后,真正难的是进客户现场,把模型、流程、权限、数据和交付结果接起来。4:53女主播对,FDE 不是把售前、实施、产品经理和工程师混成一个超人,而是说明 AI 应用还没到即插即用。客户要的是能进业务系统、能处理例外、能被审计的结果。谁能把现场复杂度吃掉,谁就离收入更近。5:08男主播另一个中文主线是世界模型和具身智能。Founder Park 今天发了万字科普,讨论为什么视频生成、机器人、自动驾驶、游戏引擎都在说自己是世界模型。量子位和机器之心也都报道了「具身原生」预训练模型,把机器人从只看见当前状态,推向能预判物理世界变化。5:29女主播这块不要被名词绕晕。世界模型真正重要的不是又多一个热词,而是它逼着模型理解时间、空间和动作后果。做机器人、自动驾驶、3D 生成的人都需要这个能力,但证据要分场景看。今天的公众号材料能支撑的是:行业正在把「看懂画面」往「预测下一步」推进,离大规模商业化还隔着数据、硬件和安全验证。5:55男主播量子位还写了 1X Technologies 的机器人手,二十五自由度、肌腱驱动,能拧灯泡、拣螺丝、拉拉链、倒茶。这个新闻很适合提醒我们,具身智能最后不是 PPT 上的 VLA 分数,而是手、关节、传感器、数据飞轮一起跑起来。硬件把软件的幻觉打得很快。6:17女主播AI 生物这边也有一条。量子位报道许锦波团队 MoleculeOS 正式开放,把 AI 生物研发从单点结构预测、抗体设计,往操作系统方向讲。这个说法当然有宣传味,但方向值得看:AI 在生物研发里不再只做一个模型小工具,而是试图组织数据、实验、设计和验证流程。6:39男主播创业融资和基础设施今天也有几条。TechCrunch 报道 Ollama 完成六千五百万美元 B 轮,由 Theory Ventures 领投,累计融资八千八百万美元。Ollama 说自己月活开发者超过八百九十万,只有十四名员工,还进入了 85% 的财富五百强。6:58女主播Ollama 的故事很典型:开源模型越来越能干以后,本地运行、模型发现、云端托管和 GPU 计费都变成开发者基础设施。它也有争议,有人担心商业化影响免费项目。但如果企业真的要把闭源模型留给高价值任务,把日常负载转向 open-weight 模型,Ollama 这种入口就会很值钱。7:20男主播芯片方向,雷峰网今天跟进了 Etched:累计融资八亿美元,估值五十亿美元,还拿到十亿美元订单。文章说它的 Sohu 芯片只为 Transformer 前向推理优化,押注通用 GPU 的效率浪费会给专用芯片留下窗口。这个来源不是官方公告,所以我们把它当背景信号,不把性能数字当已独立验证的事实。7:43女主播但这个背景信号和今天模型发布能连起来。模型厂商在前台拼功能,后面所有人都在算推理成本。OpenAI 分三档模型,Meta 强调价格,Ollama 讲 open-weight,Etched 讲专用推理芯片,本质上都在回答一个问题:智能越来越会干活以后,单位工作成本怎么降下来。8:04男主播今天还有两条产品侧的小信号。量子位报道 AI 华语音乐模型,强调从零预训练十亿参数,试图解决中文咬字和「人机味」。机器之心写百度「搭子」升级,要让 Agent 接住更多日常任务。这些不一定每条都能变成大公司,但能看到一个趋势:模型能力正在被包装成更窄、更具体、更贴近日常的入口。8:28女主播我们今天的结论可以很朴素。第一,模型发布不再只看榜单,要看路由、权限、成本和默认入口。第二,企业 Agent 的胜负不在 demo,而在上下文、系统记录和结果指标。第三,世界模型、AI 生物、AI 音乐这些垂直方向都在从单点工具往流程系统走。8:51男主播如果你是创业者,明天可以做三件事。先把自己产品里的高成本模型调用列出来,测一版更便宜模型或 open-weight 模型的替换率。再把 Agent 可以自主做和必须确认的动作写清楚,别靠口头约定。最后找一个真实业务结果做指标,比如 PR 周期、客服一次解决率、合同周转时间,而不是只统计用了多少 token。9:15女主播今天就到这。show notes 里会按话题列出本期用到的 X 推文、公众号文章和网页来源。明天早报我们再看,今天这些发布之后,企业用户和开发者到底是兴奋更多,还是开始算账更多。