7月15日 AI 创业晚间对谈:手机端备案、Agent 评测与机器支付チャプター1×0:07开场1:03手机 AI 拿到准入证3:22Agent 进入生产线5:34科学 Agent 的验证瓶颈7:00端侧智能和身体8:09机器支付先看边界10:03创业者执行表11:10端侧 AI 经营表0:0012:070:07男主播晚上好。今天白天的 AI 圈,最值得创业者记住的不是又一个模型分数,而是三个动作:手机里的 AI 开始拿到面向公众的备案,企业 Agent 开始被要求拿生产结果说话,机器自己付钱的基础设施则在补最后一块拼图。0:23女主播先交代口径。今天晚报窗口是北京时间七月十五日早上九点到晚上十点。X 关注源覆盖三百九十四个账号,分八批返回六千零三十条推文,窗口内三百二十六条,精选七条进入节目。每个账号最多读取一百条,这是当前工具的上限;本批结果没有报告失败账号。0:46男主播今天早报已经讲过机器人进厂、算力账单和 Agent 信任,所以晚报不把同一批素材换个标题再来一遍。我们看新增的终端备案、企业评测和机器支付,最后再把它们放到创业公司的产品表里。1:03女主播下午四点,国家网信办发布公告,新增七款提供手机端侧生成式人工智能服务的备案信息。官方原文只点名了「Apple 智能」等七款,新华社和人民网把名单列得更完整:Apple 智能、华为小艺 AI 大模型、AndesGPT 大模型、vivo 蓝心端侧大模型、小米澎湃 AI、盖乐世 AI,还有努比亚豆包手机大模型。1:29男主播这件事的核心不是手机厂商突然都做出了更强的模型,而是端侧 AI 被纳入了面向公众提供服务的合规流程。对苹果来说,它距离在中国大陆推出 Apple Intelligence 又近了一步;但备案和正式上线是两件事,苹果没有在这份公告里公布具体上线日期、系统版本或开放功能。1:50女主播X 关注源里的 @xiaohu 很快转发了这个变化,把它解读成国行 Siri 和 Apple 智能可能要来了。这个判断有情绪,也有市场意义,但不能直接当成产品发布。真正已经被官方确认的,只有七款手机端侧服务完成备案。2:07男主播还有一条更需要打问号。@berryxia 在 X 上转述《科创板日报》的说法,称阿里千问可能会作为能力集成到 Apple 智能里,服务中国用户。这个转述的推文没有给出《科创板日报》原文链接,本轮也没有拿到苹果或阿里官方确认,所以我们把它放在「待核消息」里,不把合作关系写成定论。2:28女主播但即使不算这条传闻,备案名单本身已经给手机 AI 带来一个现实变化:模型能力不再只藏在云端应用里,手机厂商要把模型、隐私、内容安全和系统入口一起交付。以后手机上的 AI 功能,竞争单位可能不是一个独立 App,而是一整套系统体验。2:48男主播这对创业公司有两层影响。第一,做端侧模型适配、隐私计算、设备上推理和跨厂商工具的机会会变多。第二,入口会更难拿。创业公司不能只说「我们也有一个助手」,而要回答它怎样进入系统、怎样拿到用户授权、怎样在断网时继续工作,以及出错以后谁负责。3:09女主播说白了,备案不是流量红利的发令枪,更像是产品经理手里多了一张检查表。你可以更接近系统级入口,但每一个默认打开的功能,也会带着数据、内容和责任一起进来。3:22男主播第二条线来自企业 Agent。Dropbox 创始人 Aaron Levie 在今天早上的 X 里讲了一个很朴素的判断:代码之所以特别适合 Agent,是因为它能快速测试,写出来以后可以运行测试,看应用到底工作没有。3:37女主播但合同谈判、销售话术、股票交易、客服处理这些工作,结果往往要到真实世界里才知道好不好。Levie 的结论是,企业要让知识工作也有更好的 eval,也就是一套可以重复执行的评价方法。谁能把自己的业务做成可测的任务,谁更容易知道模型、提示词或系统改了以后,到底是进步还是退步。4:00男主播这条推文和晚上九点多 LangChain 的另一条 X 接上了。LangChain 转发 Toyota 企业 AI 团队的案例,说 ToyotaGPT 用 LangGraph 搭平台,把 Agent 交付周期从六个月压到四天,目前已经有五十多个 Agent 在生产环境运行。4:15女主播这个数字很抢眼,但听众要注意它证明的不是「Agent 已经解决了企业自动化」,而是证明交付组织可以被重新设计。四天交付的前提,是有统一的平台、工具和权限边界,任务也大概能被拆成可测试的模块。没有这些前置条件,单纯买一个模型,还是六个月都未必上线。4:36男主播创业公司做企业 Agent,今天至少要在销售演示里多放三张表。第一张是任务成功率,第二张是人工接管率,第三张是出错后的回滚时间。只展示模型回答多聪明,已经不够了,客户更关心它在真实流程里会不会卡住、会不会把错误写进系统。4:58女主播而且 eval 不是上线前做一次考试。模型、工具权限、业务规则和数据都会变化,评测要跟着版本走。最理想的产品不是把一个 Agent 交给客户就结束,而是让客户能持续看到哪些任务变好了,哪些任务仍然必须由人接手。5:14男主播这也是为什么企业 Agent 的生意会从「聊天框」变成「测试系统加执行系统」。模型只是其中一层,真正能留下来的产品,要把任务定义、权限管理、观测、评测和复盘串起来。早报讲的是信任,晚报讲的是怎么把信任变成一组每天能跑的数字。5:34女主播Google DeepMind 今天在 X 上说,AI Agent 已经开始参与提出假设和设计实验,但最难的部分仍然是把想法放到现实世界里测试。它把问题直接叫作验证瓶颈,并在一篇新文章里讨论了给政策制定者和资助机构的四点建议。5:51男主播这条信息对创业者的价值,不在于一句「AI 要改变科研」,而在于它指出了一个产品边界:生成一个看起来合理的实验方案很容易,真正拿到设备、样本、流程和可重复结果,完全是另一门生意。6:05女主播机器之心今天傍晚也发了 WorldArena 2.0 Challenge 的文章。可见摘要把它定位成把世界模型评测从「好不好看」推到「是否真的有用」,同时加入物理一致性、可控性、三维准确性和具身任务功能性。这个评测方向,正好补上视频演示和真实任务之间的那段空白。6:27男主播所以世界模型、科学 Agent 和机器人模型,下一阶段都绕不开一个问题:你能不能把能力变成可重复、可比较、可追责的实验结果。创业公司如果只卖 Demo,客户会越来越难被说服;如果能卖一套验证流程,反而可能找到更稳定的收入。6:45女主播这里还有一个反直觉的地方。评测越严格,模型看起来可能越没有那么神,但产品反而更容易卖。因为客户不需要一个永远正确的机器,他们需要知道机器在哪些条件下可靠,什么时候必须停下来叫人。7:00男主播端侧这条线还有一个更具体的 X 信号。OpenBMB 转发了一段 MiniCPM-o-4.5 在本地四零九零显卡上部署到 Reachy Mini 的案例,贴文给出的端到端视听交互延迟约六百毫秒。7:13女主播这不是手机备案的同一件事,也不是一条已经验证过的商业收入,但它说明端侧和本地部署正在往「能听、能看、能动作」靠。对机器人和设备创业者来说,本地推理的价值不只是省云账单,还包括延迟、隐私,以及网络断开以后还能不能继续工作。7:35男主播把手机备案和这个本地机器人案例放在一起,终端 AI 的机会就更具体了。未来用户买的可能不是一个更会聊天的模型,而是一个在设备里持续感知、在授权范围内行动、还能给出可检查结果的系统。7:51女主播但这也意味着风险更近。云端回答错了,用户最多关掉页面;设备做错一个动作,可能碰到人、碰坏东西,或者把私人内容带到不该去的地方。端侧不是天然安全,安全要落到权限、日志、暂停按钮和人工接管上。8:09男主播最后说 x402。今天下午,X 关注源里有人讨论 Linux Foundation 接手 x402,以及 Visa、Mastercard、Stripe 等机构参与开放支付标准。我们核对到的 Linux Foundation 官方公告发布时间是美国七月十四日,换算成北京时间是七月十四日晚上,不属于今天白天的新发布,所以这部分只作背景,不算本期窗口内的首发事件。8:35女主播但 @Anitahityou 在今天下午的 X 里把它讲成 AI 时代的机器支付接口,提到 x402 正从加密货币支付协议,往更通用的 HTTP 支付协商方向移动。这个帖子是个人分析,不等于官方口径;官方资料能确认的是,x402 Foundation 已经在 Linux Foundation 的开放治理下运行,目标是让 Agent、API 和应用可以在 HTTP 交互里处理支付。9:04男主播这个方向为什么值得创业者看?因为 Agent 真要替用户订服务、买算力、调用收费 API,它就不只需要工具调用,还需要授权、预算、结算、退款和审计。支付如果没有统一协议,每一家 Agent 都要自己接一套钱包和商户系统,规模会被集成成本拖住。9:23女主播不过现在也别急着把 x402 叫作「AI 时代的 Visa」。协议有了,不等于有持续付费客户;成员有了,也不等于商户会立刻让 Agent 自主花钱。创业者要盯的是三件事:谁在真实付费,谁承担欺诈和退款,谁能限制 Agent 的消费范围。9:42男主播这和今天前面的备案、eval 是同一类问题。AI 要从建议走到执行,必须把身份、权限、验证和责任一起补上。手机端是设备在执行,企业 Agent 是流程在执行,机器支付是资金在执行,最后都要回答一句:出了问题,谁能停,谁能查,谁来赔。10:03女主播把今天的新增信息落成一张执行表。做手机 AI,先画数据流和权限流,再谈模型参数;做企业 Agent,先定义任务成功和人工接管,再谈自动化比例;做科学或机器人 Agent,先设计真实世界的验证闭环,再拿 Demo 讲故事。10:20男主播如果你要做机器支付,先从小额、可撤销、可审计的场景开始,比如调用一次收费 API,或者购买一段固定额度的算力,不要一上来就让 Agent 代表用户做不可逆的大额决策。10:36女主播投资人今天看项目,也可以换四个问题。它是不是拿到了真实入口?它的结果能不能被测?它有没有把权限和责任写进产品?最后,模型成本、设备成本和人工接管成本加起来,客户还愿不愿意付钱?10:53男主播今天早报把 AI 讲成经营账单,晚报补上了另一半:账单之外还有准入、验证和支付。模型变强只是起点,产品要进入手机、公司和交易系统,必须让每一步都能被看见、被测量,也能在出错时被停下来。11:10男主播我再补一张端侧 AI 的经营表。第一列不是模型参数,而是设备上每天真正完成了多少次任务;第二列是有多少任务必须回云;第三列是用户主动授权、暂停和删除数据的比例。只有把这三列跑出来,创业者才知道本地推理到底带来了隐私价值,还是只增加了研发成本。11:19女主播企业 Agent 也可以照这个逻辑算。别只报上线了多少个 Agent,要把每个 Agent 每周完成的任务数、人工接管次数、失败后的恢复时间和单次成本放在一起。数字不好看没关系,先把它测出来,才知道下一轮该优化模型、工具,还是流程设计。11:38男主播最后留一个可复测动作:明天把你产品里最重要的一条任务从输入、模型调用、人工接管到最终交付完整记一遍,别只看模型回答漂不漂亮。11:48女主播这期就到这里。下次看到「已经备案」「已经上线」「已经在生产」「已经能自主付费」这几句话,记得分开看,它们不是同一个里程碑。