7月18日 AI 创业早报:权限边界、专用 Agent 与开发者底座章节1×0:07今早的窗口与覆盖1:13权限事故与服务波动2:59Agent 从通用走向专用5:26开发者底座与研究进展7:15给今天的三张执行表8:49把 Agent 算进经营表0:0010:120:07主播早上好,这里是「AI 创业播客日报」。今天是七月十八日早报,先把时间范围说清楚:本期只承接上一集结束后,到今天早上九点之间的新内容,也就是北京时间今天零点到九点。上一集已经讲过的 Kimi 外部评测、Agent 评测和推理成本,今天不换标题重讲。0:27女主播这一轮我们把授权的 X 关注列表完整跑了一遍:三百九十四个账号,分成八批读取,全部批次都返回成功;一共读到六千零二十二条推文,时间窗口命中二百四十一条。按 AI、创业、产品、融资、模型和开发工具做第一轮筛选后有一百一十六条,再人工去掉普通闲聊、重复转发和没有新事实的内容,今天实际引用十二条。这里还有一个口径:接口每个账号最多返回一百条,所以这是当前接口上限内的全量,不是只挑热门账号。1:02主播指定的五个公众号在零点之后没有出现能进入本期的新文章。我们不为了凑条数把昨天白天的文章重新讲一遍。下面先讲一个和所有 Agent 创业者都有关的权限问题。1:13女主播AI 工程师宝玉在 X 上转述了 OpenAI 对 GPT 五点六删文件事件的回应。他写得很具体:在 Codex 开启完全访问、关闭沙盒、又没有打开自动审查时,模型执行清理任务,试图改写 HOME 环境变量,结果把真正的用户主目录删掉了。宝玉还说,OpenAI 准备更新开发者提示,在 Harness 里加额外安全检查,并在几天内发布事后分析。1:41主播这里必须把边界说清楚:这不是「模型天然会删除所有文件」的结论,而是一个特定权限组合下的事故转述。可执行的教训也很直接:生产机器不要默认给完全访问;需要清理目录时,先把目标路径变成白名单,再让 Agent 在沙盒里完成;自动审查被关闭时,至少要保留人工确认这一道闸。2:01女主播而 OpenAI 总裁兼联合创始人 Greg Brockman 说,GPT 五点六的 Sol 在网络安全上已经是最先进的一档,他看到它在发现和修复新漏洞上有明显结果,还邀请防守方报名使用。这个说法是能力宣称,不等于独立评测结果。放在刚才的文件事故旁边看,反差很明显:模型能力越强,默认权限越不能跟着一起放大。2:28主播另一边,Anthropic 的 Claude Code 开发者 Thariq 转发了官方说明:Fable 五这个模型在 Claude 网页端和 Claude Code 里短暂无法选择,持续大约三十分钟,问题已经修复。AI 工程师宝玉随后分享了一个个人使用案例,朋友打开 Usage credits 后,任务在模型短暂下架时切到 API 额度,几分钟内花掉了十八美元。后一个是个人经历,不是官方账单统计,但提醒很实用:自动切换模型和按量计费一定要同时设上限、告警和暂停按钮。2:59女主播产品层面的新信号更集中。Perplexity 的 CEO Aravind Srinivas 直接宣布,Perplexity Agent API 现在支持自定义 skills。原帖没有展开价格和配额,所以我们只确认到这一步:开发者可以把自己的技能或流程接到 Agent API 里,不能据此推断它已经覆盖哪些企业场景。3:18主播Y Combinator 转发了 OpenSteer 的发布。它的主张是:不要做一个什么都做的通用 Agent,而是为每一类工作做一个专用 Agent,并且只给它完成该工作所需要的工具和上下文。这个方向和上一集讲的评测问题接上了:专用之后,任务边界更清楚,输入、输出和失败率才更容易测。3:40女主播Y Combinator 还转发了 Alkera 的发布,称这是一个面向数据工程、数据分析和数据科学的 Agent,并声称在加州大学伯克利的 DataAgentBench 上排名第一。注意这里的措辞是项目方发布里的排名宣称,今天没有补到独立榜单详情,所以我们把它当成产品发布信号,不把「第一」当成已经完成的第三方结论。4:02主播LangChain 官方给了一个更容易落地的例子:它展示了一个把 RFP,也就是招标或方案需求文件,变成带引用的初稿的 Agent。流程拆成四步:先抽取范围、服务等级、报价格式和监管条款;再把要求匹配到内部批准内容;接着生成带引用的回答;最后标出需要人工处理的缺口。官方说这个系统用 LangGraph 和 LangSmith 构建,并与 Paycor 一起测量。4:29女主播LangChain 官方另一条信息也很关键:Agent 不是普通软件那种输入确定、输出确定的程序,它们面对无穷输入,输出却不确定。所以他们把 Agent 的开发生命周期写成 Build、Test、Deploy、Monitor,也就是构建、测试、部署、监控。对创业团队来说,这比「接上工具就能自动干活」更接近真实交付:每一条自动化都要有测试集、上线开关和运行监控。4:55主播创业优惠也在往 Agent 基建倾斜。参与 Cognition、Temporal 和 AI Engineer 社区的开发者 swyx 转发了 Cognition 的公告:Devin for Startups 提供六万五千美元的 Devin credits,可用于 Cloud、Desktop 和 CLI 三种形态。原帖还在招募申请,但我们没有拿到完整资格条件,所以不把它说成所有创业公司都能直接拿到。对于早期团队,真正要算的是额度能换来多少可交付任务,而不是额度面值有多大。5:26女主播开发者底座方面,PyTorch 官方公布了二点一三版本的更新范围:注意力机制、编译、分布式训练、内存效率、Python 支持和加速器平台都在调整。官方列出的具体方向包括 FlexAttention、Inductor 的 CuTeDSL 原生 DSL 后端、FSDP2 通信重叠改进、Linux 下的 Python 三点十五版本轮子,以及对 ROCm、Arm 和 Intel XPU 的扩展支持。5:54主播PyTorch 官方还说,从二点一二到二点一三包含三千三百二十八次提交,来自五百二十六位贡献者,并预告七月二十二日的线上问答。对创业公司来说,这类基础设施更新未必今天就改变产品,但会影响训练栈、部署平台和硬件选择。先确认你的关键依赖是否支持,再决定要不要升级,比看到版本号就追新更稳。6:18女主播机器之心这个中国 AI 和机器学习媒体账号分享了一项研究:福州大学和北京大学的团队做了 LIMSSR,处理的是训练阶段数据不完整的多模态任务。它不是把缺失信息简单补出来,而是让语言模型根据已有上下文推断缺失部分,并用 mask-aware 的路径减少幻觉。机器之心说,这套方法在三个动作质量评估基准上超过现有最好结果,同时不需要完整训练数据;原帖同时给了论文、代码和报道链接。6:49主播把这条研究放回创业视角,价值不在一句「超过基准」本身,而在它对应的成本约束:真实业务里的传感器、视频和日志经常缺字段,数据清洗也不可能无限补齐。能在缺失数据下稳定工作,可能比只在完整数据集上多拿几个点更接近交付。但具体收益仍要看你的任务、数据分布和复现实验,不能直接迁移成产品承诺。7:15女主播最后给创业者三张很短的表。第一张是权限表:每个 Agent 能读什么、写什么、删什么,默认全部关闭;需要放开的权限,写清路径、时长和人工确认人。7:28主播第二张是费用表:模型切换条件、每分钟或每任务上限、按量额度是否开启、异常时谁收到通知。Fable 这次短暂不可用,至少说明自动降级不能只追求不中断,还要防止不中断变成无感超支。7:44女主播第三张是交付表:专用 Agent 的任务输入是什么,验收标准是什么,失败后能不能回滚,运行中有没有监控。LangChain 的四步 RFP 流程和 Build、Test、Deploy、Monitor,提供的是一个可借鉴的骨架,不是把四个 Agent 拼起来就自动获得可靠性。8:02主播今天的结论很克制:窗口里没有新的公众号文章,也没有值得重复展开的大模型发布;真正新增的是 Agent 进入专用工作流之后,权限、费用和测试要一起设计。能力宣称可以很快,能不能把边界写进系统,才决定它能不能进入公司的日常流程。8:20女主播最后给你四个需要继续核验的点:第一,OpenAI 的 GPT 五点六事后分析,重点看 Harness 的安全检查到底加了什么;第二,Perplexity Agent API 的自定义 skills,重点看权限、版本和调用额度;第三,OpenSteer 和 Alkera 的专用 Agent,重点看公开任务集之外的真实交付数据;第四,PyTorch 二点一三,重点看你自己的编译链和加速器是否真的受益。8:49主播如果你是十人以内的创业团队,先不要问「要不要做一个通用 Agent」。先拿一个重复、边界清楚、失败代价可控的工作试算:比如 RFP 初稿、客服工单归类、数据清洗,或者内部资料检索。把人工完成一次的时间、Agent 的调用成本、需要人工复核的比例和返工时间放在同一张表里,四个数字都能测,才有资格谈效率提升。9:12女主播再把专用和通用放在同一条基线上比较:同一批输入、同一套权限、同一个验收标准。不要只比较一次跑通的最好案例,要看连续一周的成功率、平均成本、最长延迟和人工接管次数。对外卖的是结果,就不能拿模型的演示分数替代交付指标。9:34主播这也是今天几条消息放在一起的原因。GPT 五点六提醒你先做权限表,Fable 的波动提醒你做费用表,OpenSteer 和 LangChain 提醒你做任务边界与测试表,PyTorch 和 LIMSSR 则提醒你别把底层条件当成默认前提。Agent 创业真正难的部分,往往不是再接一个模型,而是把这些约束写进每天都会执行的流程。9:55女主播这里是「AI 创业播客日报」。本期来源按话题列在节目正文里,包含实际引用的 X 帖子链接。晚报再见。