7月9日 AI 创业早间对谈:语音入口、编码模型和具身上市章节1×0:07开场1:06语音入口变成新战场3:12Grok 4.5 和 Cursor 把竞争拉到价格层5:25编码评测本身开始失灵6:56国内商业化样本:上市和融资9:03收束0:0012:000:07主播早上好,今天这期我们先把边界说清楚:本期覆盖北京时间七月八日晚上十点到七月九日早上九点。X 关注流这边,我们读了三百九十三个关注账号,分八批拉到六千零三十三条推文,窗口里有三百八十七条,按 AI、创业、模型、Agent、融资这些关键词初筛出二百零一条,没有账号读取失败。所以这期不是只看热搜,而是把用户关注圈、公众号和公开网页一起去重后再讲。0:38联合主播对,而且昨晚晚报已经讲过的世界模型、具身评测、Agent 落地和基础设施融资,我们今天不换标题重复。真正的新信号集中在四件事:OpenAI 把语音交互往「真人对话」推进,Grok 4.5 和 Cursor 把编码模型竞争打到价格和分发层,OpenAI 自己出来说一个热门编码评测不可靠,国内这边则是具身智能上市和 AI 生物融资继续补商业化样本。1:06主播先说最有体感的一条。据 OpenAI 官方发布,GPT-Live 是一代新的语音模型,核心不是声音更像人,而是全双工:它可以一边听你说话,一边决定要不要回应、暂停、插话或者调用工具。换成白话,就是过去的语音助手像对讲机,现在更接近你旁边坐着一个能随时接话的同事。1:27联合主播Reuters 的报道也抓住了同一个点:这次发布的是可以同时听和说的实时语音模型。OpenAI 还说会推出 GPT-Live-1 和 GPT-Live-1 mini,两版都会面向全球 ChatGPT 用户 rollout。这个时间点很有意思,因为语音以前经常是演示很惊艳、真用很别扭;这次它开始把「能不能自然打断」这种小问题当成产品主线了。1:52主播X 上的反应也挺一致。Sam Altman 在帖里说,GPT-Live 今天进 ChatGPT,感觉很「真实」,他以前更喜欢打字,现在觉得这个习惯会变。Greg Brockman 则说,GPT-Live 像是在和智能语音 AI 自然对话,而且还只是他们内部测试里开始摸到用法。OpenAI 官方后续又发帖说,Go、Plus 和 Pro 用户已经完全 rollout,免费用户正在推进。2:18联合主播这对创业者的提醒是,语音入口不再只是客服机器人。它更像一个新交互层:你可以边走路边让它查资料、改行程、解释业务数据,甚至让它等你思考。最关键的是,OpenAI 官方写得很明确,GPT-Live 处理连续互动,遇到更深的搜索、推理和 Agent 任务,可以在后台委派给前沿模型。也就是说,前台是会聊天的耳朵和嘴,后台是能干活的模型工厂。2:47主播这里也有一个冷水。OpenAI 官方同时强调,GPT-Live 刚上线时不支持视频或屏幕共享语音,只是保留搜索、记忆、图片和文件上传等能力。它还会因为语言不同有口音或流畅度差异。所以短期最可能先起量的,不是科幻里那种全能管家,而是语言练习、通勤问答、客服跟进、销售陪练和轻量研究这种「边聊边推进」场景。3:12联合主播第二条是 Grok 4.5。xAI 官方页面说,Grok 4.5 是 SpaceXAI 面向编码、Agent 任务和知识工作的新模型,并且是和 Cursor 一起训练的。Reuters 也确认,它已经进入 Grok Build、Cursor 和 SpaceXAI 控制台,价格是每百万输入 token 两美元、每百万输出 token 六美元,欧盟要等到七月中旬。3:36主播这就不是单纯模型榜单了,而是「模型加分发渠道」一起打。Michael Truell 在 X 上说,Grok 4.5 是一个 Opus 级别、速度快、成本低的模型,是他们团队很多人的 daily driver。Elon Musk 则直接发帖让大家在 Cursor 里试 Grok 4.5。对开发者来说,模型发布页上的分数当然重要,但一个模型直接出现在 Cursor 这种工作流里,采用门槛会小很多。4:03联合主播而且它打的是非常创业的点:成本和速度。xAI 官方说 Grok 4.5 以八十 TPS 服务,平均在 SWE-Bench Pro 任务里的输出 token 更少;Elon 还在 X 上说,Grok 4.5 还没用上他们内部面向 GB300 硬件精确映射的 C 和 C++ 推理软件,当前速度可能还有翻倍甚至更多空间。这个说法当然还要看真实使用,但它给出的竞争口径非常清楚:不是「我更聪明一点」,而是「我聪明、便宜、还在你的工具里」。4:34主播创业公司要看的是这个组合拳:一边是 OpenAI 把语音入口往高频互动推,一边是 SpaceXAI 把编码模型直接塞进 Cursor。两边都在抢工作流入口。以后用户可能不会先问「我该买哪个模型」,而是打开一个工具时,默认模型已经在里面了。模型公司的商业化压力,正在从发布会转向分发渠道、价格表和实际任务闭环。4:59联合主播我还想补一句:别被「Opus 级别」这种词带跑。真正值得跟踪的是团队自己的任务集。比如你是做企业 Agent 的,要看它在长上下文、工具调用、权限边界和成本曲线上能不能稳定;你是做开发工具的,要看它在真实仓库里能不能少绕路。X 上一堆人兴奋,但落到预算表上,还是要问:它帮我少花钱,还是只是让我多试一个模型?5:25主播第三条和第二条刚好形成反差。OpenAI 官方研究页说,他们审计了 SWE-Bench Pro,发现约三成任务存在问题,并撤回之前推荐社区采用这个评测的建议。OpenAI 在 X 上也说,他们发现这个常用编码基准已经不能可靠衡量前沿编码能力,三成任务损坏,所以撤回推荐。5:45联合主播这个听上去像学术细节,但对创业者很关键。OpenAI 官方列了四类问题:测试过于严格,强迫实现细节;题目描述缺失要求;测试覆盖太低,没修完整也能过;还有题目本身会误导模型。换句话说,榜单上的高分不一定是真的会写代码,也可能是评测本身已经被模型能力、数据噪声和隐藏测试设计一起拖偏了。6:11主播更微妙的是,Grok 4.5 官方页还在用 SWE-Bench Pro 展示成绩,OpenAI 同一天又说这个评测约三成任务坏了。不是说 Grok 的能力不成立,而是说明模型竞争进入一个尴尬阶段:发布页需要数字,真实用户需要结果,评测社区却要赶紧修尺子。尺子不准,大家的市场话术就会越来越像体育比赛里争议裁判。6:35联合主播所以这期给产品和投资人的建议很简单:看榜单,但不要只看榜单。更好的做法是准备自己的小型任务篮子,里面放真实 bug、真实需求、真实文档和真实权限限制。模型在你的业务里能不能少犯错、少花 token、少需要人盯着,这比某个公共榜单多五分更有用。6:56主播国内窗口里,36氪早上八点半的几篇文章补了两条商业化样本。第一条是瑞为技术。36氪称,七月八日,瑞为技术以「视觉具身智能第一股」身份登陆港交所,香港公开发售获得三千六百四十六点零六倍认购,国际发售获得三点五六倍认购。它讲的是一条「先有场景,再讲智能」的路线。7:21联合主播这个和昨天我们聊的具身智能很接得上。很多具身故事还停在实验室里,瑞为技术的叙事是从商业空间、身份识别、客流洞察、零售和政企场景里长出来,再往「看懂之后能行动」扩。对创业公司来说,这类上市样本的价值不在于大家都去做视觉具身,而是提醒:AI 公司如果能把场景数据、交付流程和客户预算先咬住,资本市场会更容易理解你。7:49主播第二条是 AI 生物。36氪报道称,AI 虚拟细胞公司华源智因完成千万级人民币种子轮融资,团队称已经有多家头部三甲医院、跨国药企和 AI 生物企业合作订单,多项目服务费完成回款。它做的是用 AI 复刻人类细胞、预判药效,属于「模型能力进入湿实验和药效预测」这条线。8:13联合主播这条我觉得要克制乐观。AI 生物很容易讲成「发现神药」,但早期融资更值得看的是三个朴素指标:有没有真实合作方,服务费有没有回款,模型输出能不能进入药企或医院的决策流程。36氪这篇给到的是早期商业信号,不是疗效结论。创业者听到这里,重点不是追风口,而是看它怎么把高门槛科学问题拆成可交付服务。8:40主播36氪同一组早报里还提到小米汽车新独立子品牌、Claude Code 安全隐患和字节绩效规则调整。这里我们不展开,因为和本期主线相比,它们要么还需要更多一手信息,要么不是 AI 创业核心增量。但它们共同说明一件事:AI 正在从模型公司新闻,扩散到汽车、组织管理、工具安全和资本市场。9:03联合主播今天早上的主线其实很清楚:AI 的竞争正在从「谁模型更强」扩展成三层。第一层是入口,GPT-Live 让语音更像随身协作;第二层是工作流,Grok 4.5 直接进入 Cursor 和 Grok Build;第三层是可信度,SWE-Bench Pro 这种评测被审计出问题,说明大家需要更真实的业务尺子。9:25主播对创业者来说,今天最值得带走的一句话是:别只盯模型发布,盯它进入了哪个场景、降低了哪笔成本、改变了哪条工作流。语音如果能把低频工具变成高频陪伴,编码模型如果能在真实仓库里省钱省时间,AI 生物和具身智能如果能拿到真实订单,那才是从演示走向生意的信号。9:47联合主播本期来源我们会按话题放在 show notes 里,包括 OpenAI 和 xAI 官方发布、Reuters 报道、X 关注流里的关键帖子,以及 36氪、机器之心的公众号文章。不过在收尾前,我们再把这四条新闻翻译成三个创业者能用的检查项,不然早上听完很容易只记住「又发模型了」。10:08主播第一个检查项,是语音产品不要只测「像不像真人」,要测它能不能承接任务。GPT-Live 最值得关注的不是会说「嗯哼」,而是它能在对话中等待、打断、保持上下文,并把复杂任务交给后台模型。创业公司如果做语音 Agent,应该把评测场景设计成真实长对话:用户犹豫、改口、旁边有噪音、突然要查资料,系统还能不能稳住。10:34联合主播第二个检查项,是编码模型不要只看单次生成,要看它进不进工作流。Grok 4.5 这次的关键位置在 Cursor、Grok Build 和 API 价格表。对团队来说,真正影响采用的可能是三件小事:默认入口是不是顺手,失败后能不能快速回滚,月末账单是不是比原来低。只要这三个点成立,模型分数不是第一名,也可能拿到很高的真实使用量。11:00主播第三个检查项,是硬科技和生命科学项目不要只听宏大叙事,要看交付闭环。瑞为技术这类视觉具身样本,核心是场景和客户预算先成立;华源智因这类 AI 生物样本,核心是合作订单、服务费回款和模型输出能不能进入药企、医院的工作流。AI 当然会讲远景,但公司能不能活下来,常常先取决于有没有一个愿意付费的窄场景。11:27联合主播所以今天的早报可以压成一句话:入口在变轻,模型在变便宜,评测在变可疑,商业化在变具体。听起来有点绕,但这正是 AI 创业圈现在的真实状态。今天早报就到这里,晚上我们再看白天有没有新的模型发布、产品落地或者融资信号。