7月13日 AI 创业晚间对谈:Agent 基建、AI 硬件和估值切换Capítulos1×0:07开场与覆盖口径1:13Agent 基础设施3:41模型成本与限流5:26AI 硬件和机器人7:08长流程专业 Agent8:46大模型公司的估值切换10:28三张经营表12:03创业者清单0:0013:030:07男主播晚上好,先把今天这期的覆盖口径说清楚。我们看的窗口是北京时间今天上午九点到晚上十点。X 关注源这边,三百九十三个关注账号分八批读取,八批都成功;总共读到六千零三十八条推文,窗口内二百三十七条,初筛和 AI、创业、模型、Agent、机器人、算力相关的一百条,去掉验证帖、纯吐槽和弱相关之后,留下七十二条候选。每个账号最多读取一百条,这个上限继续算在覆盖说明里。0:39女主播公众号这边,量子位、机器之心、三十六氪和 Founder Park 都有窗口内可用内容;海外独角兽今天没有窗口内新文。公开网页我们补了一手或高质量来源,包括 Mistral 的机器人导航模型、OpenAI 的 Microsoft 365 Copilot 公告、arXiv 上的 LegalWorld 论文页,还有 The Neuron 的当天简报。今天不做大而全新闻播报,我们聊五个方向:Agent 的基础设施、模型成本、AI 硬件和机器人、长流程专业 Agent,以及中国大模型公司的估值切换。1:13男主播第一条,从 Agent 基础设施说起。量子位今天晚上的主文写到 AnySearch 拿下 Product Hunt 周榜第一,它的定位不是给人搜网页,而是给 Agent 提供可追溯、去噪、结构化的信息输入。文章里提到,它覆盖二十多个垂直数据源,用意图识别、同源衰减、信息密度排序,把搜索结果先过滤一遍,再交给模型。1:36女主播这件事的意思是,Agent 的第一步失败,往往不是模型不会思考,而是它拿到的资料一开始就错了。普通搜索把标题、摘要和一堆网页扔进上下文,Agent 再自己烧 token 判断;AnySearch 这类产品想做的,是把脏活提前做掉。创业者可以把它理解成,搜索正在从人类入口变成机器入口。2:01男主播机器之心今天也给了另一块拼图:浪潮信息的 Agent 基础设施。文章写到,浪潮在开放计算技术大会上发布 CPU 原生液冷整机柜服务器和元脑 SD200 超节点。它给出的判断很直接,Agent 时代不只是 GPU 推模型,CPU 要承载大量沙箱、流程调度和工具调用。文中提到,一个原生液冷 CPU 机柜最高可支持三百八十四颗多元 CPU,支撑四万多个智能体协同运行。2:31女主播这跟 AnySearch 是一条线:Agent 要真的干活,前面要有干净信息,后面要有调度和算力底座。以前大家讲「模型能力」,容易把所有问题都归到大脑不够聪明;今天这些信号更像是在说,身体、记忆、工具箱、调度系统都要补上。没有这些东西,再强的模型也会在企业流程里卡住。2:52男主播X 上也有同样的工程味。@shao__meng 今天长帖写 Skillgrade 2.0,说给 Agent Skills 写单元测试,核心主张是不要发布没有评估的 Skills。它把任务放进隔离环境,让真实 AI Agent 执行,再用确定性检查和 LLM 评分一起看结果和过程。这个点很适合企业听:未来不是谁写一段漂亮提示词,而是谁能像跑单测一样测工作流。3:19女主播我喜欢这条,因为它把 Agent 从「玄学 prompt」拉回工程。一个企业如果要把销售跟进、财务审核、代码修复交给 Agent,就不能只看演示视频。你得知道它十次里成功几次,失败时改了什么文件,有没有绕开流程,有没有违反权限。能被测试,才可能被采购。3:41男主播第二条,模型成本和限流。今天 X 关注源里,关于 Claude、Codex、ChatGPT Work、Grok 的讨论还在继续,但我们不重复早报讲过的限流松动。白天的新信号更偏成本侧。@kimmonismus 提到 GPT-5.6 的上下文窗口被压到二十七万二千 token,subagents 也在调整,所以 burn rate 应该明显下降。@op7418 则转述,Anthropic 重置和延长 Fable 5 使用时间后,OpenAI 取消 Codex 五小时限制,并做了一次新重置。4:15女主播这背后的商业问题是:模型公司现在不只比谁更聪明,还比谁能让高强度用户用得起。开发者不会因为你 benchmark 高就一直等额度恢复。他会在真正赶项目的时候换工具。今天 X 上还有人开玩笑说刷短视频赚 token,听着荒唐,但它说明用户已经把 token 当成生产资料了。4:35男主播公开网页里,The Neuron 今天把 Microsoft 用成本路由 AI 工作、SK 海力士警告二零二七年存储紧张、Mistral 进入机器人放在同一份简报里。Tom's Hardware 也报道过 SK 海力士 CEO 对存储短缺的判断,虽然那篇详情页抓取不完整,我们只把它作为背景。对创业公司来说,这几个点连起来就是一句话:推理、内存、上下文和任务编排,都会进入成本表。5:03女主播所以不要只问「哪个模型最好」。更现实的问题是,哪一类任务必须用最强模型,哪一类任务可以路由到便宜模型,哪些上下文可以压缩,哪些信息可以在外部检索而不是塞进窗口。Agent 产品的毛利,可能就差在这些小决策里。模型厂在优化 burn rate,应用公司也要优化自己的 burn rate。5:26男主播第三条,AI 硬件和机器人。Founder Park 今天独家报道,AI 潮玩品牌珞博智能 Robopoet 完成亿元级 Pre-A 轮融资,新增华映资本、广和通、涂鸦智能,红杉中国和金沙江创投继续跟投。文章还写到,Fuzozo 芙崽从二零二五年七月国内上市到二零二六年六月,国内累计销量接近三十万台,五月在日本 Makuake 众筹上线七十二小时超过三千五百万日元。5:54女主播这条不是普通玩具融资,它说明 AI 硬件正在找自己的消费入口。Robopoet 的投资方也很有意思,广和通给通信模组和全球连接能力,涂鸦智能给 AI 云平台和海外本地化。也就是说,AI 陪伴硬件要全球化,不能只靠一个可爱的壳,还要有联网、云服务、内容和长期互动记忆。6:18男主播机器人这边,Mistral 今天发布 Robostral Navigate。它是八十亿参数的具身导航模型,只用单个普通 RGB 摄像头,不靠深度传感器、激光雷达或多摄像头,在 R2R-CE 未见环境验证集上成功率达到百分之七十六点六。官方说它用约四十万条轨迹、六千个仿真场景训练,并用在线强化学习继续提升导航能力。6:43女主播这条和机器之心报道的宇树牵手湖南钢铁也能合在一起看。宇树和钢铁集团的合作说明机器人在进厂,Mistral 则是在补机器人走路和理解指令的脑子。一个是产业场景,一个是模型能力。对创业者来说,机器人赛道最容易被炫技带偏,但今天这些素材都指向同一件事:能不能低成本、稳定地在真实环境里跑。7:08男主播第四条,长流程专业 Agent。机器之心今天介绍了 LegalWorld,一个面向中国民事诉讼的生命周期交互环境。arXiv 论文页显示,这个系统基于七万五千三百零九对一审、二审民事判决,把法律咨询、一审文书、一审庭审、上诉文书、二审庭审串成连续状态链。论文还构建了 LongJud-Bench,用来评估 Agent 在五个阶段里的能力。7:35女主播这个比「法律问答机器人」要难很多。真实案件不是回答一道题,第一天咨询说过什么,后面文书怎么写,庭审里怎么回应,都会互相影响。LegalWorld 里还有客户、律师、法官不同角色,不同可见信息,还有记忆和工具。它真正想测的是,Agent 能不能在一个长周期业务里保持立场、管理证据、推进流程。7:59男主播论文摘要里还有两个数字值得记:二百一十七位法律背景评审给出一万八千九百九十二条评分,确认轨迹在程序和角色一致性上可信;模型能力评测也显示,没有单一模型在咨询、文书和庭审代理上全部领先。这个结论对企业 Agent 很关键:平均分会遮住弱点,业务要按具体环节评估。8:22女主播X 上今天也有类似信号。比如机器之心账号发了 LaPha 和 EgoTSR 这类研究,一个讲数学推理搜索,一个讲从感知到长期规划的具身推理。它们未必都能马上商业化,但方向一致:Agent 评测正在从单题答案,转向过程、记忆、规划和多步执行。以后说一个模型「很强」,你得先问,强在哪个流程里。8:46男主播第五条,回到中国大模型公司。三十六氪今天刊发一篇关于智谱的长文,核心是唐杰在七月十一日内部信《巨浪已来》里,把重点从 Coding 转到 Long Horizon Task、Autonomous Agent、Self-Evolving 和 AGI。文章的判断是,智谱不想被资本市场只按 AI Coding 或 SaaS 收入来定价,而是在 MiniMax 股价承压之后,抢先把公司叙事切到 AGI 和 Agent。9:13女主播这篇文章有立场,不能把它当财报,但它抓到了一个真实问题:AI 公司从技术信仰走向商业兑现以后,估值方式会变。讲 Coding,市场会问 ARR、留存、获客成本;讲 AGI 和长期任务,市场会继续给技术突破下注。唐杰说不追求短期应用变现,这句话既是技术选择,也是预期管理。9:36男主播对创业公司来说,这里有一个提醒。不是每家公司都有资格讲 AGI。大部分公司更适合老老实实回答收入、毛利、留存和交付效率。但如果你做的是模型、基础设施或平台型公司,资本会一直问:你是一个能赚钱的软件公司,还是一个仍在争夺未来定义权的技术公司?两种答案都可以,混着讲最危险。10:01女主播今天这些话题放在一起,其实有一个共同点:AI 创业正在从「做一个聪明演示」变成「搭一套可运行系统」。AnySearch 负责信息,Skillgrade 负责评测,浪潮和存储短缺提醒你算力账,Robopoet 和 Mistral 说明硬件和机器人要跑进真实世界,LegalWorld 说明专业流程要有长期记忆和角色边界,智谱那篇则提醒你,商业叙事也要经得起市场重估。10:28男主播如果把它落到公司经营里,我会建议团队做三张表。第一张叫信息流表,写清楚每个 Agent 任务需要哪些外部资料、内部资料和实时数据,哪些来源必须可追溯,哪些来源只做背景。AnySearch 这类产品的机会,就在这张表里:它不是多给几个链接,而是降低错误信息进入模型的概率。10:51女主播第二张叫执行表,列出每个 Agent 会改什么、能调用什么工具、谁来批准、失败时怎么回滚。Skillgrade 的启发就在这里:你不要只问 Agent 会不会做,要问它做完之后有什么证据证明做对了。代码任务可以看测试,销售任务可以看 CRM 字段和跟进邮件,法律任务可以看文书和案件状态有没有前后冲突。11:15男主播第三张是成本表。很多团队只记模型 API 单价,但真正贵的地方可能是长上下文、重复搜索、低质量资料导致的返工、CPU 沙箱调度、存储和日志。浪潮的 Agent 基建、SK 海力士的存储紧张讨论、GPT-5.6 上下文压缩,其实都在提醒同一件事:Agent 不是一个按钮,它是一条供应链。11:39女主播这三张表还能帮你判断融资叙事。你如果只能证明「我接了一个模型,界面更好看」,估值很难站住;如果你能证明自己掌握了行业数据、执行流程和成本结构,故事就扎实得多。Robopoet 有销量和供应链,LegalWorld 有真实案件轨迹,智谱有模型和平台基础,它们讲更大的故事时,至少有东西能托住。12:03男主播最后给一个实用清单。第一,做 Agent 产品,先问数据从哪里来,错误信息怎么被挡在模型外。第二,给核心工作流做评测,至少要有结果检查、过程记录和失败样本。第三,成本表里不要只写模型单价,还要写上下文长度、检索、存储、CPU 调度和人工返工。第四,硬件项目别只讲模型,要讲连接、供应链、售后和全球化渠道。12:31女主播第五,如果你在融资,别让叙事跑在产品太前面。Robopoet 能讲 AI 陪伴,是因为它有销量和海外众筹;智谱能讲长周期 Agent,是因为它已经有模型和商业化基础。没有这些底子,宏大词只会让投资人更快追问收入。今天就到这里,下面是本期来源,按话题分组放在 show notes 里。