7月17日 AI 创业早报:K 三开源冲刺,WAIC 把机器人拉到现场チャプター1×0:07K 三把开源模型的价格表也摆上桌4:02WAIC 开幕,机器人开始接受现场考试6:44一个多智能体生产案例,和一条很实用的检查表9:48创业者今天可以做的三组小实验0:0012:030:07男主播早上好,欢迎收听「AI 创业播客日报」。先说本期的时间口径:我们覆盖的是北京时间七月十六日晚上十点到七月十七日上午九点。X 关注源三百九十四个账号全部读取成功,窗口内一共读到三百八十六条推文,按 AI、创业、产品、模型、Agent、机器人和融资等主题词筛出一百七十九条相关候选,单个账号本轮最多读取一百条。指定的五个公众号里,窗口内有新文章的是机器之心,两篇,其余四个号没有新文。0:41女主播这次早报的第一条,几乎被 K 三刷屏了。月之暗面在昨晚发布 Kimi K 三,网易手机页转引财联社的报道给出的参数是两点八万亿,上下文窗口一百万 token,还支持原生视觉理解。光看参数很容易兴奋,但创业者真正要问的是两件事:它到底能不能稳定干活,成本会不会把业务先掐死。1:04男主播先把已经确认的和还在讨论的分开。网页报道确认了发布时间、参数规模和能力描述。X 关注账号里的多条帖子则集中在两个增量上:一是 K 三已经进入 Kimi Code 这类编码和 Agent 场景,二是权重很快会开放。比如 @berryxia 在北京时间早上八点二十七分说,Moonshot 的 K 三权重即将开源;但这条是社交平台转述,不等于我们已经拿到了官方权重下载页。1:33女主播还有一张价格表很有意思。@berryxia 在昨天下午转发的讨论里写到,K 三输入大约三美元每百万 token,输出十五美元每百万 token,大概是 K 二点七的五倍。这个数字我们把它当作 X 上的产品讨论,不当成官方价格公告。可它至少说明,前沿模型的竞争不只是谁更聪明,也是谁能把长任务的账算明白。1:58男主播这也是 K 三和前几天早报里 Thinking Machines 的 Inkling 不一样的地方。Inkling 那篇 36 氪文章发布时间落在本期截止之后,而且模型开放权重的消息已经在上一期讲过,所以今天不重复。K 三是本窗口内的新变化,重点是从模型发布,走到了开放权重预期、编码使用体验和价格可得性。2:19女主播X 上的情绪非常热。@kimmonismus 说 K 三的 DeepSWE 接近 Fable 五,Terminal benchmark 领先 Opus 四点八;@Anitahityou 凌晨七点二十三分又转发说,它在 Frontend Code Arena 上拿到一千六百七十九分,超过 Fable 五。两条都属于账号对公开评测的转述,我们不会把它们包装成独立审计结论,但可以确认:这已经从发布会话题变成了开发者实际拿来比较的工具。2:47男主播还有一个信号来自 @Xianbao_QIAN。他实测后说,K 三更像原生多模态和 Agent 模型,能自己点网页、迭代修改结果,代价是生成时间比较长。这种体验比一句「参数大」更接近产品判断。对创业团队来说,评测表要多加两列:一次任务是否能交付,以及交付过程需要多少人工盯着。3:10女主播我会把 K 三的创业含义说得更具体一点。第一,模型选择会从季度级换型,变成按任务路由。写代码、读长文、做视觉操作,可能分别用不同的模型。第二,开放权重如果真的按预告落地,企业会更在意部署和合规,而不是只看 API 排名。第三,价格差五倍,未必意味着贵的模型不能用,可能意味着你得把贵模型留给最后百分之十的难题。3:39男主播今天早上可以做一个很朴素的测试。拿团队最常见的十个任务,记录成功率、人工接管次数、总 token、完成时间和返工小时数。不要只测一道榜单题。K 三如果能把长任务的人工接管次数压下来,即便单 token 价格高一点,也可能更便宜;如果每次都要人类在旁边擦屁股,那两点八万亿只是很大的宣传牌。4:02女主播第二条是今天的 WAIC。证券时报在早上六点四十九分的现场报道里确认,二零二六世界人工智能大会今天在上海世博、张江和西岸的三地四馆开幕,展览总面积超过十万平方米,一千一百多家企业参展,三千多项展品亮相,超过三百款产品全球首发。4:22男主播观察者网的开幕稿又补了几组数字:大会安排一百四十多场论坛,集聚一千四百多位中外嘉宾,具身智能板块有二百零八款终端、超过三百台真机。这里有两类信息,一类是展会规模,另一类是产品是否真的在动。后者才是创业者应该去看的地方。4:42女主播机器之心今早八点发的两篇文章,标题也很有代表性。一篇叫「WAIC 机器人搭长城积木火爆展区,这才是 VLA 加世界模型的最佳用法」,另一篇叫「机器人需要看到三维未来,RynnWorld 四 D 重塑四 D 具身世界模型」。我们这轮只拿到文章列表的标题、时间和链接,没有把标题里的判断扩写成性能结论,但标题本身已经说明展会讨论从单个机器人动作,转向世界模型和真实任务。5:12男主播这和过去看展不太一样。以前大家会问机器人能不能走、能不能抓,现在更该问它能不能在陌生任务里完成闭环:看见什么,怎么计划,失败后能不能修正,动作是不是能重复。只展示一次成功动作,仍然是 Demo。把任务随机化,把失败记录下来,才接近产品。5:32女主播对创业公司来说,WAIC 的现场其实是一张采购表。硬件公司要说明传感器、关节和维护成本,模型公司要说明训练数据和推理延迟,做系统集成的公司要说明谁来承担事故责任。展台上的机器人如果很会挥手,但没有报价、交付周期和售后边界,创业者看完还是只能回去发朋友圈。5:56男主播可以把今天看到的设备分成三层。第一层是能在展台完成固定动作的展示机,适合看技术路线。第二层是能在工厂、仓库或实验室连续工作一段时间的系统,适合看交付。第三层是已经有明确客户、运行指标和维护合同的产品,才适合看生意。WAIC 的热闹不等于三层都已经成熟,别把展览数字直接写进收入预测。6:21女主播我特别想提醒一个容易被忽略的成本:现场真机越多,后端数据和运维越重要。机器人不是手机,出了一个偶发错误,可能不是重启一下就完事。你要采集动作日志、故障样本、环境变化,还要有人处理远程升级和安全隔离。具身创业的毛利表里,不能只列硬件 BOM,还要把现场工程师写进去。6:44男主播第三条来自 X。@aakashgupta 在北京时间七月十七日早上六点十四分分享了一个公司内部黑客松案例:三十个工程团队参加,最后一位产品经理获胜。她做的是一个双 Agent 审稿循环,一个 Agent 先写,第二个 Agent 按公司的真实标准挑错,问题回到第一个 Agent 重写,最后接入真实代码库并上线生产。7:08女主播这个案例有意思,不是因为它又用了两个 Agent,而是因为它把「公司标准」写进了审查环节。很多企业 Agent 失败,不是模型完全不会做,而是团队没有说清楚什么算合格。只要标准模糊,Agent 就会很勤快地交付一堆看起来像样的东西,最后还是人来返工。7:27男主播所以今天的 Agent 采购清单,可以从功能清单换成验收清单。第一,输入资料能不能留痕。第二,第二个 Agent 的审查规则是不是来自真实生产数据,而不是一句泛泛的提示词。第三,失败后能不能回到具体步骤重做。第四,负责人能不能看到每次改动和人工接管点。7:48女主播@levie 还在窗口里说,前沿智能成本下降,会让企业可以部署更多过去被 token 价格挡住的工作流。这个判断和上面的案例正好接上:模型便宜,只是让试验更容易;真正能变成收入的,是把工作流、企业数据和验收标准接起来。否则你只是买了更多便宜的调用量,然后得到更多没人敢签字的结果。8:13男主播这里也要留个反方。@tbpn 转述 Benchmark 的观点说,前沿实验室不一定会立刻消灭垂直 AI 创业公司,因为实验室还有更大的市场要做。这个观点不能当成安全承诺,但它给创业者一个现实方向:不要只做一个模型套壳的功能,要把行业流程、数据反馈和责任边界做深。实验室越强,通用能力越便宜,垂直交付反而越需要现场经验。8:39女主播那今天的三分钟执行表来了。模型表,测十个真实任务,记成功率、接管次数、token 和返工时间。机器人表,除了 Demo,问连续运行、故障率、维护和责任。Agent 表,给每个自动化动作配一个审查人、一个回滚点和一条日志。没有这三张表,发布会再热闹,也很难变成创业公司的下一笔收入。9:08男主播再补一张成本表。K 三这种超大模型,除了输入和输出单价,还要把缓存命中率、上下文长度、失败重试和人工复核一起算进去。一个任务如果第一次调用便宜,但失败后要重复三次,再加半小时人工整理,它的真实成本就不是接口账单。相反,一个贵模型如果能一次交付,可能反而适合做最后的决策步骤。9:32女主播机器人和 Agent 也一样,别把一次性演示当成单位经济。机器人要看每小时有效工作时间、故障恢复时间和现场维护人数;Agent 要看每一百次任务有多少次人工接管、多少次回滚、多少条日志需要复核。9:48男主播把今天的热闹变成实验,第一组是模型实验。把一个真实的产品需求拆成短任务、长任务和需要看图的任务,每个任务跑三次,不只记录最后答案,还记录第一次可用的时间、重试次数和人工改动行数。K 三如果在长任务上更强,就把它放在规划和代码审查;如果只是榜单分高,却让团队花更多时间等结果,那就别急着把主力流量全迁过去。10:14女主播第二组是机器人实验。去 WAIC 看真机时,别先问「它是不是最聪明」,先问四个问题:在什么环境里工作,连续工作多久,失败后谁来接管,客户按什么结果付费。能拿到现场日志最好,拿不到就至少记下动作成功的定义。机器人从 Demo 到订单,中间差的不是一句「世界模型」,而是可重复的工序和可追责的服务合同。10:40男主播第三组是 Agent 实验。先选一个低风险、可回滚的内部流程,让第一个 Agent 做草稿,第二个 Agent 按公司规则找错,人类只审批高风险节点。连续跑一周,比较单 Agent、双 Agent 和人工流程的总成本与缺陷率。成本下降不等于价值上升,只有缺陷率、交付时间和责任边界同时改善,才值得扩到客户现场。11:06女主播还有个小原则:先在内部跑通,再把最小闭环交给一个真实客户,不要一上来承诺全自动。能清楚告诉客户哪里自动、哪里需要人、哪里可以回滚,往往比再多一个榜单第一更能促成续费。11:21男主播最后收一下今天的判断。K 三把开放模型的性能、价格和可用性放在同一张桌上,WAIC 把具身智能从海报推到真机和真实任务,那个多 Agent 案例则提醒我们,企业要买的不是会聊天的机器人,而是能被验收的工作流。早报就到这里,晚上十点我们再看白天的新变化,避免把同一件事换个标题重讲。11:43女主播感谢收听。完整来源按话题放在节目文字页里,X 的每条实际引用推文也会列出账号和链接。祝大家今天少做一点演示,多拿一条真实的运行数据。