AI听:模型开放之后,AI开始要有身份证和刹车Chapters1×0:00开场:开放之后,谁能真正使用 AI0:49第一章:开放,不只是把权重放出来2:32第二章:开放模型,也要有安全基础设施3:59第三章:Agent 上岗,先解决它是谁5:48第四章:会行动的 AI,必须能证明自己7:26第五章:开源模型的第一笔账,不是订阅费9:16第六章:应用公司要在模型缝隙里活下来10:52第七章:家庭中枢和具身模型,都需要刹车13:16收束:AI 的下一张成绩单0:0014:430:00主播晚上好,这里是 AI 听。今天的主线,可以用一句话概括:模型开放之后,AI 开始需要身份证,也需要刹车。0:10主播昨天我们还在讨论开放模型会不会改变入口竞争。今天更具体的问题已经出现了:模型和训练过程到底开放到什么程度,企业能不能安全地授权一个 Agent,普通团队又能不能承担部署和运维成本。开放不再只是一个技术态度,而是一套要落到责任、权限和账单上的系统。0:33主播今天我们沿着三层来看。第一层,模型开放从权重走向训练过程。第二层,Agent 从工具变成了需要身份管理的协作者。第三层,真正落地之前,还要过安全验证和成本验证。0:49主播先看模型这一层。三十六氪今天报道,月之暗面把 Kimi K3 的模型权重、技术报告,以及支撑训练的 MoonEP、FlashKDA 和 AgentEnv 等关键基础设施一起开放。报道提到,Kimi K3 是二点八万亿参数的混合专家模型,还支持一百万个 token 的上下文。1:10主播这些数字很大,但真正值得注意的是「一起开放」。如果只有一个模型文件,开发者拿到的是结果;如果连训练技术和基础设施也一起公开,研究者才有机会理解它是怎么被训练和部署的。不过,开放权重不等于训练数据、全部流程和所有安全边界都自动透明,能下载也不等于普通团队跑得起。1:35主播机器之心今天写上海 AI 实验室的 ArchSpace,进一步把开放推向过程:全量 checkpoint、训练日志、架构采纳和取舍实验都尝试公开。它的意义,是把「论文里最后选了什么」扩展成「一路试过什么,为什么放弃什么」。对开发者来说,这会让复现、排错和改造更有依据;对研究机构来说,也能减少只看最终成绩单的误判。2:04主播从这个角度看,开放其实有几层。最外层是接口开放,别人可以调用;再往里是权重开放,别人可以下载和部署;更深一层是训练过程开放,别人能看到数据处理、检查点和实验取舍;最难的是责任也要可追踪,出了问题能知道是哪一层出了偏差。今天的变化,是行业开始同时讨论后面几层,而不是把一个下载链接当成全部开放。2:32主播腾讯研究院今天的 AI 速递提到,英伟达、Adobe、微软、IBM 和 Hugging Face 等机构正在推动开放安全 AI 联盟。这个方向很关键,因为模型越开放,防守方越希望能把它放进自己的设施里检查和运行,而不是把敏感日志交给一个外部接口。2:54主播但这里有一个不能跳过的矛盾:开放能让更多人检查,也可能让更多人获得更强的能力。开放模型发布以后,很难像关闭一个 API 那样撤回使用权。所以安全不能靠一句「开源更安全」解决,而要变成持续测试、权限控制、审计记录和风险分级。3:15主播对企业而言,开放安全基础设施的价值不在于把每个模型都部署到本地,而在于建立一套统一的检查入口。模型进来之前要测,升级之后要回归,连接工具之前要看权限,任务结束之后要留日志。这样即使模型供应商发生变化,企业仍然保留自己的安全判断,而不是每次换模型都重新相信一遍供应商。3:41主播这也是今天的第一个判断:开放的下一阶段,不只是模型开放,而是安全工具、评测标准和责任边界也要开放。谁能把可检查的模型和可执行的安全流程接起来,谁才有机会把开放模型带进企业。3:59主播模型有了,企业还不能直接把它放进工作流。海外独角兽今天讨论的主题很直接:当 Agent 成为 coworker,企业首先要设计的是身份系统。4:10主播文章引用的调查口径是,百分之九十一的组织已经在使用 AI Agent,但只有百分之十拥有比较完善的非人类身份管理策略。这个数字来自文章援引的行业调查,不是所有企业的统一统计,但它指出了一个普遍的错位:大家已经让 Agent 干活,却还没有把它当成一个需要被授权、被追踪、被撤销的主体。4:35主播人类员工登录系统,通常有一个稳定账号;Agent 却可能代表不同的人、不同的任务、不同的时间窗口。它需要回答两个问题:谁把这项工作委托给它,以及它这一次究竟被授权做什么。更合理的权限,不应该是一张长期有效的万能钥匙,而应该跟着任务动态生成,任务结束后失效。4:59主播如果一个 Agent 替销售整理客户资料,它需要的身份和权限,应该不同于替财务付款的 Agent;如果同一个模型在测试环境和生产环境工作,它也不应该沿用同一套凭证。企业真正要管理的不是一个抽象的「AI 员工」,而是一组具体的委托关系:谁发起、访问什么、能持续多久、由谁验收。5:22主播卡尔的 AI 沃茨今天也分享了一个作者实测的多 Agent 工作流:把模型分成深度推理、快速执行和仲裁三个身份,高风险问题让两个模型背对背独立回答,再由仲裁者比较。这个例子未必适合所有团队,但它提醒我们,身份不只是登录名,也可以代表职责、风险等级和验收方式。5:48主播身份之后是行动。量子位今天报道,深信服 Sangfor AI 在 CyberGym 的一千五百零七项漏洞挑战中完成了一千三百零一项,成功率百分之八十六点三,文章将其列为全球前四、国内第一。这里要注意,数字来自企业相关报道和竞赛口径,不能直接等同于真实生产环境的安全能力。6:13主播更值得听的不是排名,而是它采用的做法:Agent Swarm、证据管治、有界探索、证据持久化、动态假设裁决,以及对抗式候选评审。换句话说,安全 Agent 不能只交一个「我发现了漏洞」的答案,还要留下它看到了什么证据,尝试过哪些路径,哪些判断被推翻,以及人类如何复核。6:37主播这实际上改变了 Agent 的交付物。过去软件交付一个结果文件就够了,今天高风险 Agent 还要交一份可以复盘的过程记录:输入是什么,调用了哪些工具,在哪一步改变了判断,最后由谁批准。记录不是为了让人看完模型的全部思考,而是为了让团队在出错时定位事实、重放操作和修正规则。7:03主播这套标准其实适用于所有高风险 Agent。一个会写代码的 Agent,要能留下测试结果;一个会操作企业系统的 Agent,要能留下授权和操作记录;一个会调用资金、支付或生产设备的 Agent,更要有明确的暂停条件。行动能力越强,证明链就越不能缺席。7:26主播再看成本。虎嗅今天的标题很有画面感:老板让作者部署免费的 K3,他先算了一笔承担不起的机房账。标题里的「免费」和「承担不起」放在一起,正好说明了开源模型最容易被忽略的部分。7:43主播权重可以免费拿到,但算力、存储、散热、网络、运维和故障恢复都要付钱。三十六氪的报道也提醒,二点八万亿参数模型的本地部署,对普通个人和小团队并不轻松。更现实的选择可能是 API、云端托管或更小的蒸馏版本,而不是一上来就买一整套集群。8:06主播这会改变企业的评估方式。以前问的是「哪个模型最强」,现在至少要同时问四件事:每次任务多少钱,峰值时延是多少,数据能不能留在自己的环境里,出了故障谁来接管。所谓模型自由,只有在账单和运维都能承受时才成立。8:26主播还要把一次性采购和长期运营分开算。硬件是一次性账单,电力、机房、模型升级、监控、备份和人工响应却会持续发生。小团队如果只比较模型调用价格,可能会忽略自己为了保持可用性付出的工程成本。很多时候,最便宜的方案不是自己部署最大模型,而是按任务把轻量模型、云端模型和人工确认组合起来。8:54主播更实际的模型路由,可能是简单问题走低成本模型,需要长上下文时走开放模型,涉及敏感数据时走私有部署,最后把关键结论交给人复核。这样企业买到的不是「一个永远最强的模型」,而是一套在不同风险和预算下仍然能工作的方法。9:16主播模型变便宜,应用公司会不会消失?晚点今天发布了对 Liblib 创始人陈冕的长访谈。这里的收入、估值和现金流,主要是创始人对公司的自述,不能当成审计数据;但它提供了一个很有价值的视角:应用公司的危险,恰恰来自模型能力快速进化。9:37主播陈冕在访谈中说,模型能力一变化,原来的产品空间就可能塌掉,所以公司要快速寻找下一个产品形态。Liblib、Lovart 和 LibTV 的经历,说明应用层的价值不只是把模型接进来,而是把模型能力和用户需求重新对齐,包括定价、交互、工作流和内容质量。10:02主播这也解释了为什么身份和成本会成为产品能力的一部分。应用如果不能控制上游 Token 成本,就很难承诺稳定价格;如果不能区分不同用户和任务的权限,就很难把 Agent 交给企业;如果没有自己的工作流和用户关系,模型一升级,应用就可能被覆盖。10:24主播所以应用层并不是简单地站在模型下面收一层服务费。它真正要做的是把不稳定的模型能力包装成可理解、可定价、可复用的工作结果。模型更新时,应用要替用户承担迁移;成本波动时,应用要重新安排路由;任务失败时,应用要提供人工接管。谁能持续承担这些脏活,谁才可能在模型快速变化的缝隙里留下来。10:52主播最后看两个更靠近现实世界的方向。爱范儿今天写苹果的 AI 屏幕,设想由新的 Siri 家庭中枢去接管家里的设备、信息和服务。无论最终产品何时落地,这个方向都把问题从「它会不会回答」推进到了「它能不能替我操作家里的东西」。11:13主播家庭设备一旦被 Agent 接管,身份和权限就不再是企业专属问题。它能不能开门、付款、购买东西、修改摄像头设置?哪些操作需要主人确认?家里不同成员的权限怎么区分?一个温和的家庭场景,反而把刹车问题变得非常具体。11:33主播甲子光年今天专访智在无界,提到 Being-H 零点八把人类视频预训练规模扩大到超过五十万小时,并在预训练阶段加入人手和物体的接触信息。文章同时强调,从基础模型到具体场景仍需要后训练,模型现在还不能直接投入所有家庭和工厂。11:54主播这就是具身模型和家庭 Agent 的共同难题:不能只展示「看起来会动」,而要说明它在什么环境、什么权限和什么成功率下可以行动。一个会碰到真实物体的模型,必须知道什么时候继续,什么时候停下,什么时候把控制权交还给人。12:13主播对家庭设备来说,刹车不一定是一个醒目的停止按钮,也可以是分级确认。播放音乐、调节灯光可以自动完成;开门、付款和删除录像需要确认;涉及儿童、老人或安全设备的动作,还要有更严格的身份校验。对机器人来说,遇到视觉遮挡、接触状态不确定或任务超出训练范围,也应该主动降级,而不是为了完成指令继续猜。12:42主播这类边界设计看起来会降低自动化程度,但它换来的是更高的可用性。真正进入家庭和工厂的系统,不需要每一步都问人,却必须在不可逆的那一步问对人。12:55主播还要考虑失效之后怎么办。网络断了,模型超时了,设备状态和它看到的不一致了,系统应该回到上一次确定状态,而不是继续执行半完成的计划。家庭 Agent 最终能不能被信任,不只看它平时有多聪明,也看它在异常时能不能安静地停下来,把现场交还给人。13:16主播把今天的线索放在一起,AI 的下一张成绩单,可能不再是单一模型的最高分,而是四个问题能不能同时回答:第一,它是谁,代表谁做事;第二,它被允许做什么,权限什么时候失效;第三,它为什么这么判断,证据能不能复查;第四,运行成本和失败代价,谁承担得起。13:41主播对开发者来说,今天可以开始把模型、工具、记忆和评测拆开,不要让一家公司同时握住所有选择。对企业来说,先做身份、权限、日志和回滚,再谈让 Agent 自主运行。对普通用户来说,开放模型会带来更多选择,但「能下载」和「能放心使用」之间,仍然隔着一整套安全和成本的工程。14:09主播如果把它压缩成一张实用清单,就是四个先后顺序:先确认数据能不能离开你的环境,再确认 Agent 代表谁;先设置不能做什么,再决定让它做什么;先设计失败回滚,再追求自动化比例;最后才是比较模型榜单上的几个百分点差距。14:29主播所以,模型开放之后真正稀缺的,可能不是又一个更大的模型,而是让它在正确的身份下,做正确的事,并且在做错之前停下来。这就是今天 AI 听的全部内容,晚安。