7月18日 AI 创业凌晨对谈:Kimi 外部评测、Agent 评测与算力成本챕터1×0:07窗口说明与 Kimi 的新反馈2:22Agent 从聊天走向评测和工作流4:18推理成本、硬件与电网5:58WAIC 的 GPU 展台和开源软件栈6:48DeepSeek 交易隐含估值7:54结尾0:008:420:07男主播先报窗口。上一集结束在北京时间7月17日晚上10点28分,本集只取之后到午夜的新内容。X关注列表一共394个账号,八批读取全部成功,实际读取约6006条推文,窗口命中49条,最后保留14条相关帖子。每个账号最多读取100条,所以这是当前接口口径下的全量,不是只看三五条热门推文。0:33女主播公众号这边,量子位在晚上11点21分发了两篇新文章,36氪最近一篇是晚上10点14分,早于窗口起点,Founder Park、机器之心和海外独角兽没有窗口内新文。先从X上关于Kimi K3的新反馈说起,早报讲过发布本身,今晚只讲新出现的外部比较和测试计划。0:55女主播X账号 kimmonismus 的 Chubby,个人简介是科技分析师、AI内容创作者,也是 Superintel 主编。他说,Kimi K3开发者的说法让他觉得,K3和 Fable 5、GPT-5.6 Sol 的差距正在缩小,甚至可能反超。这里保留的是他的解读,不当作独立跑分结论。1:14男主播硅谷AI和机器人观察者 Robert Scoble,个人简介写的是「关注AI、机器人、全息舱和脑机接口,曾任微软、Rackspace和Fast Company员工」。他转发 David Sacks 的帖子,提到Kimi K3在 Frontend Code Arena 拿到第一。转发内容没有给出完整分数,节目只把它作为一条外部讨论记录。1:37女主播沃顿商学院研究AI、创新与创业的教授 Ethan Mollick 连发两条。一条说,国产开放权重模型已经很强,他给出的个人比较是 K3 好于 GLM-5.2,GLM-5.2 又好于 DeepSeek v4;另一条说,英国政府的AI安全机构准备在权重开放后几周测试Kimi K3,测试会同时看它是否接近公开前沿,也会引出网络安全讨论。这两条都是他的判断和信息披露,不能替代测试报告。2:07男主播Grok官方账号只发了一句:Grok Build 和 Grok 4.5 位居用户模型偏好前列,没有附样本、时间范围或方法。它可以算一条厂商自报信息,不能和前面的外部比较放在同一可信度层级。2:22男主播Meta AI高级总监 Madhu Guru,个人简介是「曾在Google负责Gemini、Veo和Nano Banana」。他把企业Agent难以超越基础聊天机器人的原因归为人才缺口,具体指两件事:能不能把用例写成离线和在线评测,评测能不能表达目标并推动系统越过能力的锯齿边界。2:41女主播AI教程作者 Peter Yang,个人简介是「为忙碌的人制作实用AI教程和访谈」。他展示了一个让 Codex 或其它 harness 管理邮件和日历的定时任务:列出待处理邮件、可以退订的邮件,以及会议简报,先交给自己审核。他还向读者征集各自的定时任务,重点是把Agent放进可检查的工作流。3:03男主播X账号 vista8 的向阳乔木,个人简介是「喜欢摇滚乐、爱钓鱼的PM」。他提醒AI创业团队,产品要提前准备防白嫖和逆向Hack,并称已经听到几家朋友的公司因此损失惨重。帖子没有披露公司、金额或案例细节,所以这里只记录风险提示,不延伸成损失统计。3:27女主播创业点子作者、Startup Ideas 播客主持人 Greg Isenberg,个人简介写的是「每天发布创业点子,也在创建多家公司」。他的原话是,十二个月前多数工程师还在手写代码,现在多数代码已经由AI生成。这是个人观察,不是行业抽样调查,但它和前面两条放在一起,指向同一个具体变化:代码生成正在进入日常工作,评测、审核和权限控制也必须跟上。3:53男主播最后一条工作流相关帖子来自 Jackywine。他的简介是「Obsidian VIP、Prompt Engineer,长期学习 OpenAI、Anthropic 和 DeepSeek,业余分享AI、设计和产品」。他提醒,使用大模型后,人容易高估自己真正理解和掌握的知识。这同样是个人观点,但对企业培训和Agent审核很直接:能生成答案,不等于能检查答案。4:18女主播Coursera联合创始人、斯坦福计算机系兼职教师、曾任百度AI负责人和Google Brain负责人的 Andrew Ng,转发了一门和 Cerebras 合作的短课。课程主题是用适合快速推理的硬件,让大模型应用更快响应;帖子还指出,生成文本的大量时间花在搬运模型权重上。它不是新的模型发布,而是把推理延迟直接放到硬件和系统设计上。4:44男主播Box CEO Aaron Levie,个人简介是「Box CEO,帮助企业用AI释放内容价值」。他说,AI越便宜,整个生态,尤其是最终客户,就越有机会受益;当前很多部署都受制于能不能以可接受成本跑在真实工作负载上。他还提到,用前沿模型做编排、用更便宜模型做规模化,会带来使用增长,也会让利润率问题更早出现。这是企业软件CEO的判断,不是财报数据。5:12女主播工程杂志 IEEE Spectrum 的简介是「来自全球领先工程杂志的最新科技新闻与分析」。它提醒,数据中心不只是耗电大户,需求的不可预测性也在以新的方式考验电网。对AI创业公司来说,推理成本表不能只写GPU租赁价格,还要看供电、峰值和部署地点的约束。5:34男主播AI开发者社区参与者 swyx,个人简介里列出 Dxt、Cognition、Temporal 和 AI Engineer 等关联项目。他观察到,X文章似乎可以用引用一条AI视频来获得更高传播,再把原视频链接放在首条回复并注明说话者。这是内容分发经验,和模型能力无关,但对做AI产品教育、开发者内容和创业获客的人有参考价值。5:58女主播量子位晚上11点21分的现场文章写到,沐曦在WAIC展示曦景S600超节点,单机柜64张GPU,可扩展到万卡集群;同时发布面向AI4S的曦索X300系列科学智能GPU。展台中央还留给了十个开源社区,包括龙蜥、vLLM和PyTorch基金会。6:18男主播同一篇文章给出几组软件栈数据。沐曦称,MXMACA对近5000个热门开源项目做自动化测试,92%的项目不改代码就能运行;针对 PyTorch 2.8,2410个GPU算子做到完整兼容;已经开源53个软件仓库,占其软件栈的15%到20%,并与 vLLM 官方签署合作。节目把这些都标为沐曦和量子位文章披露的数据,不把它改写成全行业性能结论。6:48女主播量子位另一篇晚上11点21分的文章,追的是安徽开润股份7月16日晚间披露的投资进展。公告显示,开润参与的一只基金实缴29亿元,间接取得DeepSeek 0.8265%的股权,对应计算出的交易隐含估值约3508.8亿元。开润全资子公司宁波浦润投入4000万元,穿透后约持有DeepSeek 0.0114%,用这组数字算出来约3509亿元,两个算法接近。7:19男主播路透社同日核对了这份交易所披露,把3508.8亿元换算成约518.2亿美元,并特别提醒,这只是交易隐含的股权估值,公告没有说明是新股、老股还是不同权利,不能直接当成DeepSeek官方确认的融资轮估值。7:36女主播量子位文章还提到4500亿元和下一轮约5000亿元等不同口径,但这些没有得到DeepSeek或投资方确认。本集只保留已经披露的29亿元、0.8265%、0.0114%和交易隐含估值,不把传闻当结论。7:54男主播今天的增量就停在这里。模型侧是Kimi K3出现更多外部比较和后续安全测试计划;Agent侧是harness、evals、定时任务和反滥用;基础设施侧是快速推理、成本、供电和国产GPU软件栈;资本侧只有一笔可以从上市公司公告穿透出的交易隐含估值。8:15女主播本期正文末尾会按话题列出全部来源:14条实际使用的X帖子、量子位两篇文章和路透社一篇报道。X帖子的作者身份也都在节目里先交代了。下一期再有新事实,我们从新的时间点接着走,不把同一条消息换个说法重复一遍。