7月11日 AI 创业早间对谈:模型进办公室,Agent 开始接活チャプター1×0:08开场1:17第一章:模型进办公室,入口开始换形状3:49第二章:Agent 工具战,开始从「会说」变成「会做」6:59第三章:模型竞赛变成了 harness 竞赛8:50第四章:中国侧信号:物理 AI 和机器人数据效率10:52第五章:创业者今天能拿走什么0:0013:060:08主播早上好,这期按早报窗口补齐,时间只看北京时间七月十日晚上十点到七月十一日早上九点。先交代覆盖范围:X 关注源这次读完三百九十三个关注账号,全部成功;一共拉回五千九百八十条近况,其中二百八十八条落在窗口内,关键词初筛后一百三十八条和 AI、创业、模型、Agent、开源、具身智能有关。这里有个上限要说清楚:每个账号最多读取最近一百条,所以这是当前工具能力下的全覆盖窗口筛选,不是无限历史回溯。0:42女主播也就是说,这期不是把昨晚晚报的 GPT-5.6 再讲一遍。晚报已经覆盖了新模型和 ChatGPT Work 的主发布,这期只看之后冒出来的新动作:模型进办公套件,语音入口被重新强调,安全悬赏变得更具体,Agent 工具开始从演示走向接活,国内这边则有物理 AI 和机器人数据效率的线索。听起来像一夜之间大家都在说同一句话:模型本身还重要,但产品壳、工作流和交付能力开始更重要。1:17主播第一条,还是绕不开 OpenAI,但我们换个角度。据 Sam Altman 在 X 上转发,GPT-5.6 已经成为 Microsoft 365 Copilot 的 preferred model。OpenAI 的官方文章说,GPT-5.6 会进入 Word、Excel、PowerPoint、Copilot Chat 和 Cowork,目标是让用户用更少提示完成文档、分析、演示和跨团队协作。这里的重点不是又一个模型名,而是分发位置:它直接进了每天已经在用的办公软件。1:49女主播这对创业公司很现实。过去大家讲模型能力,容易变成跑分表;但进 Office 之后,比较的其实是每个 token 能不能变成一个完成的文档、一页像样的 PPT、一张能解释业务的数据表。OpenAI 文章里还强调 performance per dollar,翻成创业者听得懂的话,就是模型再强,也要能在企业预算里跑得动。大客户不会为了浪漫多付钱,它们会为了少返工、多产出、多合规付钱。2:20主播同一晚,Greg Brockman 在 X 上说,ChatGPT Voice 是一个 real advance,他的判断是人会越来越少盯着屏幕,今天的应用回头看会显得很不友好。这句话挺像产品路线图:当语音变自然之后,AI 不只是一个聊天窗口,而是变成一个能随时接住上下文的入口。对创业者来说,入口从屏幕转到语音,不只是交互变了,获客、留存和任务边界都会变。2:50女主播但 OpenAI 这晚同时也在补安全账。OpenAI 官方 X 账号说,Bio Bug Bounty 会变成长期私密项目,奖励翻倍到五万美元,邀请有 AI 红队、安全或生物安全经验的研究者,去找能突破预设生物安全挑战的 universal jailbreak。这个信号很重要:越是把模型塞进 Office、语音和健康这种高频场景,越要给危险能力装刹车。它不是公关层面的「我们重视安全」,而是把悬赏和攻击面具体化了。3:24主播还有一个小信号也值得放进同一组。Greg Brockman 在窗口末尾又提到 GPT-5.6 for health intelligence,说团队在这方面持续改进。我们不展开成医疗结论,因为这条 X 本身信息很短;但它和生物安全悬赏放在一起看,就能看到 OpenAI 的双线压力:一边把模型推进高价值场景,一边要证明它不会在高风险场景里失控。3:49女主播第二组是 Agent 工具。Manus 在 X 上宣布加了一个 /game-dev skill,用户描述一个游戏,Manus 就能生成可玩的 gameplay,并部署成可分享链接。这个功能看上去很玩具,但我觉得它不只是「AI 做小游戏」。它把 Agent 的交付物从一段回答,推进到一个可运行、可传播、别人能打开的成品。4:14主播对,创业者可以用它想一个更大的问题:未来很多 AI 工具卖的不是「我会回答」,而是「我交付一个能被使用的东西」。游戏只是最容易展示的一类,因为结果有没有跑起来,一眼就能看出来。这个标准会反过来逼产品设计:你要有部署、有状态、有回滚、有可分享链接,否则就还停留在 Demo。4:36女主播Claude Code 这边也有同样的趋势。Claude Code 官方 Week 28 文档确认,桌面版现在有内置浏览器,Claude 可以打开文档、设计稿或任意网站,阅读、点击并与页面交互。Cat Wu 也在 X 上说,Claude Code 可以用生产应用、打开链接、查 Twitter,甚至看世界杯。听上去有点夸张,但底层变化很清楚:编程 Agent 不再只盯着本地文件,它开始能看真实网页和真实产品界面。5:06主播官方文档里还有两个细节值得创业团队学。第一,浏览器是 sandboxed,可配置会话是否持久;第二,外部网站动作会经过安全分类器。也就是说,能操作网页不等于随便乱点。真正进入生产流程的 Agent,必须同时具备行动能力和边界感。这里的边界不是一句「请小心」,而是权限、隔离、持久化策略和动作审查。5:33女主播LangChain 的 Harrison Chase 这一晚连发了两个很实用的信号。他先说,如果想要 Sierra、Ramp、Stripe、Coinbase 这类内部 coding agent 的开源版本,可以看 OpenSWE;他们自己也内部使用,主要做 coding,模型无关,开源并和 LangSmith 做可观测性集成。GitHub 页面也写得很直白:OpenSWE 是给组织构建内部 coding agent 的开源框架,强调云沙盒、Slack 和 Linear 调用、子 Agent 编排、自动 PR。6:08主播这就是 Agent 创业的另一个分水岭:从单个聪明模型,变成一套组织工作流。你要接 Slack,要接工单,要有沙盒,要能开 PR,要能观测。Harrison 还提到 LangChain 和 NVIDIA 合作推出 NemoClaw DeepAgents blueprint,把 Deep Agents、Nemotron 3 Ultra 和企业 runtime 放在一起;同一条里还说 OpenWiki 在做个人大脑式记忆。模型、执行环境、记忆和可观测性,开始变成同一套栈。6:37女主播这也解释了为什么这一晚很多人都在说「model alone is no longer the product」。模型不是不值钱,而是只有模型还不够卖。创业公司的机会可能在中间层:让模型拿到对的上下文,在安全沙盒里做事,把过程记录下来,最后交付一个能被团队接住的结果。6:59主播第三组,是模型竞赛开始搬到 harness 里。Perplexity 的 Aravind Srinivas 在 X 上说,他很看好 Grok 4.5。在 Perplexity Computer harness 里,Grok 4.5 在内部 WANDR 基准上拿到最高分,这个基准衡量 agentic research capabilities;他说它的价格大约是 Claude Opus 4.8 high 的一半,还比他们当前的 GLM 5.2 后训练模型更好,成本大致相当。7:26女主播注意这里最有意思的不是谁第一,而是评测环境。不是「模型裸跑」,而是在 Computer harness 里面跑 agentic research。换句话说,创业者以后选模型,不能只问「哪个模型最聪明」,还要问「放进我的工具链、上下文、预算和任务分解之后,哪个组合最稳」。同一个模型在不同 harness 里的表现,可能差很多。7:50主播窗口里还有一些用户体感也支持这个判断。有人在 X 上说 GPT-5.6 Sol 的体感不如 Fable 5 省心,也有人说 GPT-5.6 Luna 在 agentic coding benchmark 上以较低成本追近 Fable 5。我们不把这些当最终结论,因为它们是单个用户或局部基准;但它们说明一个事实:现在前沿模型已经进入「一周一个强对手」的状态,创业公司如果把商业壁垒押在某一个模型领先,很容易被下周的新模型冲掉。8:19女主播所以更好的姿势是押在模型可替换性上。今天用 Sol,明天用 Grok,后天用 Claude 或开源模型,产品层最好都能切。LangChain、Perplexity 这些信号都在说同一件事:真正的产品是编排、记忆、工具、权限、成本控制和结果验证。模型像发动机,但车架、刹车、仪表盘和维修体系一样重要。8:50主播第四组看中国侧信号。36氪在窗口内发布了对话 Om AI 赵天成的文章,标题是「多年坚守,押注物理AI原生的流式未来」。这篇详情页这次被微信环境校验挡住,我们没有读到全文,所以这里只使用账号工具返回的标题、发布时间和摘要。摘要里提到,一个从未见过监控画面的多模态模型,却在监控场景里比长期在监控数据上训练的小模型更懂监控。这个叙述指向的不是「再训一个垂直小模型」,而是物理 AI 原生能力如何进入真实场景。9:26女主播这条和昨晚提到的世界模型、具身智能其实是一条线,但今天不重复讲旧话。新信息是:国内创业公司正在把物理世界理解能力往安防、视频流和持续感知里落。它不像生成图片那么好展示,却更接近企业愿意付费的场景:看得懂、接得住、持续运行,还要比传统小模型少一点定制成本。9:51主播机器人这边,机器之心英文 X 账号在窗口末尾发了一条 ATHENA 的论文线索。它说,同济大学、上海人工智能实验室、西安交大和上海交大的研究者提出一种机器人数据筛选方法,让十亿参数级视觉语言动作模型里 influence functions 变得可用。帖子里给出的结果是:仿真里只用一半 demonstration 就能达到或超过全数据微调;六个真实机器人任务里,用大约三分之二的数据达到全量数据表现。10:23女主播这个对具身智能创业特别关键。机器人最贵的不是发一条推文,是采数据、清数据、知道哪些数据有用。ATHENA 这类方法如果能落地,价值不是「少训练一点」,而是让团队知道该采什么、丢什么、哪些演示对任务结果影响最大。具身智能现在最大的问题之一是数据不像互联网文本那么便宜,数据效率本身就是商业壁垒。10:52主播把这些线索合在一起,今天早报的主题其实很集中:模型继续变强,但竞争场已经往产品、场景和系统迁移。OpenAI 进 Copilot、推语音、补 Bio Bug Bounty;Claude Code 加内置浏览器;Manus 把自然语言变成可分享游戏;OpenSWE 把内部 coding agent 开源化;Perplexity 用 harness 比较 Grok、Claude、GLM;机器人研究在抠数据效率。每一条都在说,下一轮 AI 创业不是只拼模型参数,而是拼「能不能稳定把模型变成工作」。11:28女主播给创业者三个判断。第一,别只做聊天框。能交付文件、代码、网页、游戏、报告、PR、监控结论的产品,才更接近付费。第二,别把某个模型当护城河。用可替换架构、评测集和成本仪表盘,随时换发动机。第三,高风险行业要把安全和审计前置。生物安全、健康、金融、企业内容治理这些方向,不是上线后再补免责声明就够了,产品早期就要设计权限、日志、红队和回滚。12:06主播最后,再把覆盖边界说清楚:这期按早报窗口只采到九点之前的材料,所以九点二十一分之后 36氪、量子位等公众号的新文章不会进本期。X 关注源这次覆盖账号全部成功,但每账号读取上限是一百条;如果极少数超高频账号在窗口前后发帖超过这个上限,仍可能存在尾部遗漏。我们宁愿把这个边界说出来,也不把抽样包装成绝对全量。12:34女主播这期就到这里。今天上午真正值得盯的,不是「又出了几个模型名字」,而是这些模型正在被塞进办公软件、浏览器、沙盒、游戏生成器、机器人数据管线和安全悬赏里。AI 创业的热闹还在,但门槛正在从会讲故事,变成会交付、会验证、会负责。