7月13日 AI 创业早间对谈:限流松动、企业 Skills 和算力供给Capítulos1×0:07开场0:58订阅和限流2:45模型嘴仗和评测4:20企业 Agent 和 Skills6:07Token 账单和工程习惯7:44算力、存储和开源基础设施9:24今天能带走的三件事0:0011:540:07男主播早上好,今天这期先给一个覆盖口径:我们按昨晚十点到今早九点的窗口,扫了三百九十三个 X 关注账号,八个批次都成功;总共读到六千零六十条推文,窗口内一百六十九条,其中和 AI、创业、模型、Agent、算力相关的有八十五条。每个账号最多读取一百条,这个上限也继续算在覆盖说明里。0:30女主播公众号这边,窗口内真正命中的主要是量子位和三十六氪;Founder Park、机器之心、海外独角兽在这个夜间窗口没有新增可用主条目。公开网页里我们补了 Economic Times 对 Anthropic 的报道,以及 OpenAI 自己的 Skills 帮助页。今天不是大而全新闻联播,重点是一个变化:模型公司开始从「不给用」转向「先放开一点试试」,创业公司要重新算成本账。0:58男主播先说最热的一条。据量子位今早文章和 Economic Times 报道,Anthropic 把 Claude Fable 5 在付费计划里的访问延到七月十九日,同时 Claude Code 的每周限额继续维持百分之五十的加量。X 上 @dotey、@shao__meng、@berryxia 这些账号也都在转同一个体感:OpenAI 这边,Codex 和 ChatGPT Work 临时移除了五小时使用限制,部分用户还看到用量重置。1:27女主播这件事听起来像福利,其实更像压力测试。过去两天,用户骂的不是模型不够聪明,而是「我刚要干活,额度没了」。@kimmonismus 说自己不只是五小时限制没了,rate 也重置了;@shao__meng 提到 ChatGPT Work 和 Codex 活跃用户已经到七百万。这个数字我们只当 X 讨论里的口径,不扩写成官方财报,但它说明用量焦虑已经变成产品体验的一部分。1:54男主播对创业者来说,真正该看的不是哪家更慷慨,而是谁能把单位任务成本压下来。@berryxia 的判断是,OpenAI 敢开闸,可能是因为 GPT 五点六 Sol 的效率优化让同样资源能跑更多任务。量子位文章也把 Codex 五小时限制移除、Fable 5 再延七天放在一起讲。这里的商业信号很直接:模型厂从卖「最强」进入卖「可持续使用」。2:22女主播而且这会改变开发者的默认选择。以前大家可能会说,我要把最难的任务留给最贵的模型;现在如果 Codex、Claude Code、Grok Build 都在抢「日常长时间在线」,那入口就不是 benchmark 第一,而是谁最少打断我的工作流。这个窗口里很多 X 帖子都在吐槽 token anxiety,翻译成人话就是:AI 工具已经像水电一样被用,一停水用户就暴躁。2:45男主播第二条是模型嘴仗继续升级。@elonmusk 昨晚发帖说,Grok 四点五在一些软件 benchmark 上甚至略高于 Fable;同一小时,他还说 Grok 四点五是浏览器使用上的 Opus class。另一边,@alexandr_wang 发帖称 Muse Spark 一点一在一个有限模型理论和理论计算机科学的新评测上超过 Opus、Grok 四点五和 Gemini。3:09女主播这里要加一层冷水:这些都是发布方或相关方口径,不是独立评测。能进今天节目,是因为它反映了竞争焦点变了。模型厂现在不只比通用聊天,还在比软件工程、浏览器操作、理论题、设计输出。创业公司如果只拿一个综合分数选模型,会越来越容易踩坑,因为你的任务可能根本不在那个分数覆盖的场景里。3:35男主播我更在意的是评测背后的数据来源。Grok 四点五被很多人拿来和 Cursor、浏览器、编码任务一起讲;X 上也有开发者说 Grok Build 的 plan review、conversation compacting 这些细节让它更像工具,不只是模型。对于做 AI 应用的人,这提示很明确:把模型包进工作流后,产品层数据会反过来决定模型怎么进化。3:58女主播所以今天的结论不是「谁赢了」。比较靠谱的做法是给自己的业务建小评测:真实工单、真实代码仓库、真实客服对话、真实设计稿,让不同模型跑同一组任务,记录成功率、耗时、人工返工和总成本。模型厂会继续吵,创业公司最好别跟着吵,账单和交付质量才会告诉你答案。4:20男主播第三条,企业 Agent 的形态更清楚了。OpenAI 官方帮助页今天更新了 Skills in ChatGPT,里面说 Skills 是可复用、可分享的工作流,可以包含指令、示例和代码;个人 Skills 已面向 Business、Enterprise、Healthcare 和 Edu 用户,并且也支持 Codex 和 API。它还写到,企业和教育版管理员如果没有选择退出,OpenAI 计划从七月二十三日开始默认开启 Skills。4:50女主播这就不是一个小功能了。它等于把「一个员工反复教 AI 怎么做事」变成「公司把流程打包给所有人」。但别被名字带偏,Skills 不是魔法,它更像可管理的 SOP:谁能创建,谁能上传,谁能分享,管理员能不能看使用记录,这些都写进了帮助页。企业真正买的不是 prompt,而是流程可以被复用、审计和收回。5:14男主播X 上 @rauchg 的说法也正好接上:把模型变成你自己机器里的一个齿轮,企业要拥有自己的数据、评测、模型选择和软件层。@levie 讲得更偏管理:企业未来要把自己的决策、洞察、工作流和最佳实践变成能复利的信息资产,同时还要能路由不同智能等级的模型,记录 traces,用 evals 检查工作流。5:39女主播这两条放一起看,企业 Agent 的生意不是「帮你买一个更聪明的聊天框」,而是帮你把公司内部的隐性流程变成可运行的系统。创业者可以问自己三个问题:第一,我帮客户沉淀的是不是他们独有的数据和流程;第二,我有没有评测能证明结果变好;第三,客户换模型时,我是不是还能继续留在工作流里。如果三个问题都答不上来,那你很可能只是模型 UI 的临时皮肤。6:07男主播第四条说一个看似小、其实很实用的点。@dotey 昨晚长帖讨论了 Caveman 这种「电报体 Skill」:它让 Claude Code、Codex 这类工具少说废话,项目 README 号称能省百分之六十五输出 token。但他引用 JetBrains 测试说,在八十六个真实编程任务里,强制开启后输出 token 只省了百分之八点五。6:29女主播这个例子很适合给团队泼冷水。Agent 的成本大头往往不在它回你那几句客套话,而在系统提示词、工具调用、上下文、MCP、反复读写文件。你把回复改成「母病速归」式短句,当然能省一点,但如果一次任务读了半个仓库、调用了十几次工具,这点省出来的 token 只是零头。6:50男主播更麻烦的是,省掉的信息可能刚好是人需要审计的部分。比如 Agent 只说「fixed auth, tests pass」,你不知道修的是登录过期、权限校验还是刷新令牌,也不知道跑的是单元测试还是完整测试。对于创业团队,正确的节流不是让 Agent 装哑巴,而是减少无效上下文,明确工具边界,让计划自包含,同时保留风险说明。7:16女主播这也能解释为什么今天 Skills、Harness、Agent API 这些词同时出现。真正省钱的不是一句 prompt,而是把工作拆成便宜模型能执行的部分和昂贵模型必须判断的部分。@shao__meng 分享的设计工程师 Skills 里也有类似思路:贵模型负责理解代码库、判断什么值得修、写清楚计划;执行可以交给便宜模型或子 Agent。别省在话术上,要省在架构上。7:44男主播第五条看硬件和基础设施。三十六氪今早的八点一氪里提到,SK 海力士 CEO 郭鲁正预计,二零二七年可能成为存储行业供应最紧张的一年;客户在寻求长期供货协议,需求持续增长,但产能有限。报道还提到,SK 海力士考虑「内存即服务」,让客户租用存储资源,而不是只买芯片。8:05女主播这对 AI 创业公司很现实。模型更便宜,不等于底层资源就真的宽松。前面说 OpenAI 放开限制、Claude 延长访问,背后都要有人付算力和存储账单。三十六氪同一篇还写到长鑫科技 IPO 申购安排和国产存储融资规模,说明资本也在往供给链上下注。做应用的人别只盯 API 价格,供应链紧张会通过延迟、配额、稳定性传到你面前。8:33男主播X 上也有对应的技术侧信号。@Xianbao_QIAN 说开源基础设施正在改变体验,提到 GLM 五二 FP8 原始模型在一个 Agent harness 里能做到每路两百多 token 每秒的 decode;@SemiAnalysis_ 则提醒,很多 AI 芯片创业公司声称有「魔法编译器」,可以把任何模型高效映射到自家芯片,但现实往往需要大量手工调优。8:56女主播这两条放在一起很有意思:一边是开源模型、推理框架、LiteLLM、vLLM 这些基础设施让应用速度变快;另一边是硬件公司不能只靠 PPT 说自己什么模型都能跑。创业团队选基础设施时,最好拿自己的负载压测,不要只看供应商给的单模型峰值。Agent 时代的体验不是平均速度,而是多子任务并发、工具调用、缓存命中和失败恢复一起算出来的。9:24男主播讲到这里,可以把今天早上的信息落成一个小清单。第一件事,是把模型使用从「体感」改成「账本」。团队里谁在用 Codex、谁在用 Claude Code、哪些任务经常触顶、哪些任务其实便宜模型就够,要按任务记录下来。否则限额一松大家就欢呼,限额一紧又只能拍脑袋换工具。9:47女主播第二件事,是别把 Skills 当成新鲜玩具。OpenAI 官方文档已经把创建、分享、管理员控制和 API 支持写出来了,这说明大客户要的是可管理的工作流。创业公司如果做企业 Agent,可以从一个部门里的重复动作切进去,比如销售线索整理、合规材料初审、代码迁移检查,先把流程跑稳,再谈更大的智能。10:12男主播第三件事,是给基础设施留退路。今天三十六氪的存储供给预警,和 X 上关于开源推理、AI 芯片编译器的讨论,其实指向同一件事:你的产品不能只依赖单一模型、单一云、单一硬件口径。至少要提前准备缓存策略、降级模型、任务排队和账单报警,不要等用户已经在生产环境卡住才想补救。10:37女主播这三件事做起来不酷,但会决定公司能不能把 AI 从 demo 带进真实业务。demo 阶段大家比谁的视频更惊艳,生产阶段比的是失败以后谁能恢复、账单上涨以后谁能解释、模型换代以后谁还能保持交付。今天早上的新消息,真正值钱的部分就在这里。10:58女主播但创业公司别被热闹带走。今天更值得记的是三张表:第一张是模型使用表,记录每个任务花多少钱、失败几次;第二张是企业流程表,哪些工作能被 Skills 或 Agent 固化;第三张是供给风险表,算力、存储、开源依赖和硬件路线有没有替代方案。把这三张表补齐,比追着每条 benchmark 吵架更有用。11:23男主播今天早报就到这里。本期来源会按话题列在节目页,包含窗口内用到的 X 帖子、量子位和三十六氪文章,以及 Economic Times 和 OpenAI 帮助页。晚上十点我们再看白天有没有真正新增的产品、融资和政策信号,不把今天早上已经讲过的同一事件换个标题重讲。