7月12日 AI 创业晚间对谈:模型限流、Agent 进公司和机器人触觉챕터1×0:07开场1:11模型能力上探,用户被额度教育3:17Agent 进公司,难点从演示转向流程5:17研究和工具链:代码 Agent 还没毕业6:51具身智能:从会动,到会协作、会触觉、会被评估8:28法务和安全:模型公司开始吃硬件公司的苦10:07明天可以直接做的三项检查12:06收尾0:0013:090:07男主播今晚这期先把口径说清楚:我们扫了北京时间今天早上九点到晚上十点之间的材料。X 关注源覆盖三百九十三个账号,实际拉回六千零四十三条推文,窗口里一百七十条,其中和 AI、创业、模型、Agent、机器人相关的有九十四条。单账号读取上限还是一百条,所以极高频账号有可能还有漏网内容。0:28女主播公众号这边,量子位、Founder Park、机器之心今天白天都有新增 AI 内容;三十六氪有一条苹果起诉 OpenAI 的跟进,但这件事源头是七月十日,所以我们把它放在法律风险那一段,不把旧新闻硬说成今天爆出来。0:44男主播好,今天的主线挺清楚:模型越来越强,但用户开始被限流和成本卡住;Agent 终于不只是聊天框,而是要进企业流程;机器人和世界模型也从「看起来很厉害」走到「怎么评估、怎么协作、怎么摸到东西」。1:01女主播翻译成人话就是,AI 圈今天没有一个单点大炸弹,但有很多很烦人的细节。烦人的细节,往往才是创业公司会不会赚钱的地方。1:11男主播第一块,模型。X 上 Elon Musk 今天只发了一句,据他的帖子,用户可以自己去试 Grok 四点五。句子很短,但互动量很高,它说明模型厂还在用「你自己试」这种方式争夺心智。1:25女主播问题是,用户现在试模型,已经不是单纯问「聪不聪明」。X 上 Chubby 今天连发两条很典型:一条说 GPT 五点六从高档调到中档,五小时额度还是快被烧完,三次重置也用光;另一条说 Fable 五的订阅计划今天结束,GPT 五点六 Sol 可以顶上,但 rate 太大,实际使用还是受限。1:48男主播这就把模型竞争拉回一个很朴素的问题:前沿能力如果只能在演示里爽,到了真实工作里被额度切碎,用户会开始算账。不是说能力没用,而是能力要能稳定供给,才会进入日常生产。2:02女主播我觉得这里有个创业机会,也有个坑。机会是帮用户在不同模型之间调度,把高价值任务给最强模型,把重复任务交给便宜模型。坑是,如果你只是套一层路由,模型厂自己很快也会做。2:18男主播Perplexity 的 Aravind Srinivas 今天也从另一个角度讲了类似判断。他在 X 上说,本地模型可能会变成默认入口,负责控制和调用更耗电、更聪明的前沿模型。这个说法对创业者很关键:入口不一定永远在最大的模型那里,入口可能在最懂任务、最会省钱的那一层。2:38女主播对,用户不关心你是不是旗舰模型,他关心「今天这活能不能做完,别把我额度烧穿」。Jiayuan Zhang 今天也发了 Codex 的使用配置,说模型五点六 Sol,Effort 选 Extra High 或 Max,Speed 选 Standard,能省 usage;他还吐槽 Ultra 加 Fast 一个任务就可能跑完五小时限制。这种帖子看似很工程师碎碎念,其实是需求信号。3:00男主播所以今天第一条判断是:模型能力还在卷,但用户的痛点正在从「有没有智能」转向「智能怎么被稳定、便宜、可控地消费」。这会把一批产品从模型崇拜拉回预算管理、任务拆分、上下文压缩和本地模型调度。3:17女主播第二块,企业 Agent。Founder Park 今天发了一篇 WorkBuddy 的 Harness 工程复盘,标题就很直:从模型到可用 Agent,Harness 工程是怎么做的。它讲的是把模型能力变成产品,不只是把大模型接进聊天窗口。3:33男主播同一个方向,Founder Park 还有一篇 WAIC 预热文,里面提到一个很扎心的数据:二零二六年,百分之八十的企业应用已经内嵌至少一个 Agent,但只有百分之三十一的企业真正有 Agent 在生产环境运行。这个差距,差不多就是创业公司的战场。3:52女主播X 上宝玉今天整理了 Anthropic 关于 Agent 基础设施的对谈。按他的转述,Claude 平台团队提到,几个月前做 Agent 还需要很多流程控制代码,现在模型推理和工具调用变强,编排层在变薄;重点从控制每一步,转向设计 Agent 之间怎么协作。4:10男主播他还提到一个很实用的 ROI 观察:先看一个人用了 Agent 之后快了多少,不要一上来就画跨部门自动化大图。这个建议很像创业公司做销售时该说的话。别跟客户说「我重塑组织」,先让某个岗位今天少花两小时。4:26女主播Aaron Levie 今天那条推文也能接上。他说,AI 原本被认为会替代软件岗位,但软件招聘反而跑赢其他领域。原因是软件生产成本降低后,大家想要更多软件,新的项目会冒出来,维护、取舍、长期运行还是需要人。4:45男主播这条我会稍微保守一点。Levie 是 Box CEO,他的判断很有产业体感,但它不是一份严谨就业统计。我们可以把它当成企业软件从业者的观察:Agent 不一定直接减少人,它也可能让需求膨胀。5:00女主播创业者听这段可以抓三个字:别包圆。企业 Agent 最容易死在「我什么都能自动化」。更可行的切口,是一个岗位、一个流程、一个可衡量的产出。比如需求文档到开发环境,代码实现到 QA 测试,先把一小段链路跑通。5:17男主播第三块,说说代码和研究工具。Replit 的 Amjad Masad 今天在 X 上发了一个挺有意思的例子:他把一个 Qwen 八 B 模型微调来下棋,在 Replit 上同时跑三个实验分支。他的感受是,模型做机器学习的能力进步很快,有直觉的人即使没受过完整训练,也能做一些有意思的 ML 工作。5:39女主播这句话很有诱惑力,但别听成「人人都能一键当研究员」。机器之心英文账号今天发的 CODA-BENCH 更像冷水。它说人大研究团队推出了一个测试代码和数据智能的基准,Agent 要在大量 Kaggle 数据集和复杂文件系统里写代码做真实分析,顶级系统在一千零九个任务上的成功率也只有百分之六十一点一。6:01男主播这个数字说明,代码 Agent 最容易在 demo 里显得很聪明,因为 demo 通常边界清楚、文件少、目标明确。可一旦进真实数据分析,文件结构乱、变量名怪、数据质量差,Agent 就会暴露短板。6:15女主播这也解释了为什么今天那些「省 usage 配置」「两个模型互相 code review」的帖子会有共鸣。不是大家喜欢折腾参数,是因为工具还没稳定到可以完全托管。你要知道什么时候让 Fable 五写代码,什么时候让 GPT 五点六 Sol review,什么时候别让它开太快。6:34男主播所以这块的创业判断是:面向工程师的 AI 产品,下一阶段不只是做更炫的编辑器,而是要把真实项目里的脏活管住。包括文件理解、测试回放、上下文留存、成本控制,以及失败时能不能解释到底卡在哪里。6:51女主播第四块,具身智能。量子位今天有两条很适合放在一起看。一条讲「具身智能的 Harness」,意思是机器人不只要单台完成动作,还要像团队一样被组织、调度、检查和扩展。7:06男主播另一条讲破晓智能,机器之心也有同题报道。核心点是触觉。文章里的例子很直观:机器人手指碰到喷壶扳机,视觉上像完成了动作,但水没喷出来,因为它没有真正把扳机压下去。对于人来说这是手感问题,对于机器人就是基础模型缺了一块输入。7:25女主播这比「机器人又会端咖啡了」更有信息量。端咖啡的视频看多了会麻木,但触觉这件事很难糊弄。物理世界不是屏幕,碰到了不等于按下了,抓住了不等于拿稳了。7:38男主播机器之心今天还发了南京大学团队关于世界模型评估的立场论文。它提醒大家,世界模型这个词太热了,机器人、自动驾驶、视频生成都在用,但如果评价指标跟不上,大家很容易各说各话。7:53女主播机器之心另一篇讲 Agentic 推荐系统也可以放进这个框架。推荐系统过去是平台猜用户想看什么;Agentic 时代,可能变成用户的 Agent 主动表达目标,甚至替用户和平台协商。听起来很远,但它和机器人一样,本质都是控制权从平台脚本,慢慢移到用户目标和智能体协作上。8:14男主播这块对创业者的启发是:具身智能不只卖硬件,也会卖评估、数据、调度和安全边界。谁能把「看起来会动」变成「可重复、可度量、可协作」,谁才更接近真实交付。8:28女主播最后一块,风险。CNBC 七月十日的报道确认,苹果在加州北区联邦法院起诉 OpenAI,指控它窃取商业秘密,用于发展自己的消费硬件。三十六氪今天也跟进了这件事。8:43男主播CNBC 报道里有几个细节很硬:苹果称 OpenAI 硬件负责人 Tang Tan 指导仍在苹果工作的候选人,把苹果的实际零件带到面试里展示;还指控前员工 Chang Liu 带走苹果笔记本,并利用漏洞访问内部文件。OpenAI 的回应是,它无意获取其他公司的商业秘密。9:02女主播这件事对 AI 创业公司有提醒。只要你从软件走向硬件,人才流动、供应链、设计文件、面试材料,都会从「团队快跑」变成「证据链」。以前挖一个大厂牛人,大家说这是人才红利;现在对手可能说,这是商业秘密风险。9:18男主播安全这边,CBS 七月八日报道,中国国家漏洞库警告 Claude Code 存在安全后门风险,可能在用户不知情时传输位置和身份相关标识。量子位今天的文章把这个话题接到蚂蚁安全的产品视角,强调 AI 安全已经被推到台前。9:36女主播这里也要分清楚:CBS 报道里 Anthropic 没有回应 AFP 的置评请求,但 Claude Code 工程师 Thariq Shihipar 曾在 X 上说,相关实验是为了防止未授权转售和模型蒸馏,之后会回滚。所以这不是一句「确认有恶意后门」就能概括的事。9:54男主播但对企业客户来说,解释原因是一回事,采购风险是另一回事。Agent 能读代码、改文件、调用工具,它拿到的权限越大,安全审计就越不能是上线前的橡皮图章。10:07男主播在收尾前,我想把今天这些信号再压成三个检查项。第一个是成本检查。别只问你的产品用了哪个最强模型,要把一次完整任务拆成三段:入口理解、执行和验收。入口能不能用本地小模型或便宜模型,执行是不是只有关键步骤才调用前沿模型,验收能不能用规则或小模型先挡一遍。10:31女主播这个检查很现实。今天那些关于 GPT 五点六 usage 的吐槽,本质不是用户小气,而是工作流会被额度打断。创业公司如果能让用户清楚看到「这一单为什么花了这些 token,哪里可以省,哪里不该省」,它就比只会喊「我们接了最强模型」更像一个工具。10:50男主播第二个是流程检查。企业 Agent 不要先卖「全公司自动化」,先挑一个人、一个岗位、一个可量化结果。比如销售每天少整理半小时线索,客服少切三个后台,工程师少做一次重复测试。能在一个人身上闭环,再谈团队。11:08女主播而且闭环里一定要有失败出口。Agent 做错时,是交给人确认,还是自动重试,还是换更强模型?这几个分叉如果没有设计,演示越顺,真实上线越危险。11:21男主播第三个是风控检查。今天苹果和 OpenAI 的诉讼、Claude Code 的安全预警,都在提醒我们:AI 产品只要进到客户文件、代码库、设计资料和内部系统,权限边界就不是法务部最后一天补的文档,而是产品设计的一部分。11:37女主播所以明天开会可以直接问:我们记录了哪些数据?哪些会出公司网络?员工离职或客户停用后怎么清掉?面试、测试、客服排障里有没有可能碰到别人的机密材料?这些问题听着不酷,但企业客户会越来越早问。11:53男主播这三项检查加起来,其实就是一句话:模型能力在涨,但产品可信度要跟着涨。能把成本、流程和风控说清楚的团队,才有机会把今天的热闹变成明天的合同。12:06女主播今天收束一下:模型还是强,Grok 四点五、GPT 五点六、Fable 五都在抢注意力;但用户已经开始被额度、订阅和成本教育。企业 Agent 的热闹,也开始从「会不会聊天」变成「能不能进生产流程」。12:21男主播具身智能这边,别只看视频是不是炫。触觉、评估、团队协作这些听起来不性感的东西,可能更接近商业化。法律和安全也一样,越接近真实工作,越不能只靠一句「我们是 AI 公司」绕过去。12:38女主播如果你明天要做一个小决策,我会建议先问两件事:你的 AI 产品是在帮用户省钱,还是在替用户烧额度?你的 Agent 是真的接进流程,还是只是在聊天框里把话说得更漂亮?12:50男主播这期就到这里。下一期我们继续看夜里到明早的新增信号,尤其是模型订阅、企业 Agent 和具身智能这三条线有没有实质更新。